AI И НЕЙРОСЕТИ

Почему создатель AlphaGo спорит с идеей, что LLM умеют рассуждать

Ход 37 AlphaGo в 2016 году стал символом машинной интуиции, но его автор видит в нём урок: LLM не рассуждают как учёные.

✍️ Редакция iTech News | 03.10.2026 | ⏱ 4 мин | Источник: MIT Technology Review
🌐

В 2016 году AlphaGo обыграла Ли Седоля со счётом 4:1, а ход 37 во второй партии стал одним из самых обсуждаемых эпизодов в истории ИИ. Теперь один из создателей системы утверждает: именно этот ход показывает, почему LLM не рассуждают в строгом смысле слова, сообщает MIT Technology Review. Для разработчиков и бизнеса это не философская придирка, а вопрос доверия к ИИ в медицине, инженерии, науке и продуктах, где ошибка стоит дороже красивого ответа.

Автор текста вспоминает март 2016 года в Сеуле: AlphaGo поставила камень на пятую линию доски в го, и многим комментаторам это показалось подарком сопернику или программным сбоем. На деле ход 37 оказался сильным решением, после которого система выиграла партию, а затем и весь матч против Ли Седоля, одного из лучших игроков в го. Сам Ли позже признал, что перестал воспринимать AlphaGo как «просто машину», потому что этот ход выглядел творческим.

Ключевая мысль автора: ход 37 был не вспышкой магической машинной интуиции, а результатом архитектуры, где интуиция и проверка гипотез работали вместе. AlphaGo состояла из двух важных частей. Первая, policy network, оценивала, какой ход мог бы сделать сильный человек. Для неё ход 37 выглядел почти невероятным: примерно один шанс из 10 000, что так сыграет профессионал. Вторая часть — механизм поиска — строила дерево возможных продолжений и проверяла, что случится дальше после разных вариантов.

Это резко отличает AlphaGo от больших языковых моделей. LLM подбирает следующий токен снова и снова, опираясь на статистические связи в данных. Такая модель может писать убедительно, программировать, решать часть математических задач и имитировать рассуждение. Но, по позиции автора, это ближе к быстрому ассоциативному мышлению, чем к самостоятельной проверке гипотез. У AlphaGo был отдельный слой поиска, который мог отвергнуть правдоподобный ход и выбрать странный, если дерево будущих позиций показывало его силу.

После выхода ChatGPT 30 ноября 2022 года индустрия быстро столкнулась с ограничением одной лишь языковой беглости. Ответом стали техники вроде chain of thought: модель не отвечает сразу, а генерирует промежуточные шаги, разбивает задачу на части и только потом выдаёт результат. Это действительно улучшило качество в математике и кодинге. Но автор подчёркивает: такая цепочка всё равно создаётся тем же механизмом предсказания следующего токена. Модель не получает отдельный модуль рассуждения, она просто дольше говорит сама с собой.

В тексте названы три причины, по которым такое поведение не стоит путать с рассуждением. Во-первых, у чат-ботов обычно нет явного и проверяемого состояния знания: списка гипотез, уровня уверенности, доказательств, открытых вопросов и того, что уже отброшено. Во-вторых, знания и операции над ними смешаны внутри весов нейросети, поэтому нельзя отделить «что система знает» от «как она этим пользуется». В-третьих, цепочки рассуждений могут быть объяснением задним числом: модель приходит к ответу одним путём, а описывает другой, более красивый и убедительный.

Для потребительского чат-бота это неприятно, но терпимо: пользователь может перепроверить рецепт, письмо или фрагмент кода. В медицине, проектировании, научных исследованиях и других областях с высокой ценой ошибки такая непрозрачность становится системным риском. Если ИИ предлагает диагноз, план лечения или инженерное решение, важно понимать не только итог, но и маршрут: какие данные использовались, какие допущения были сделаны, где возникла ошибка и можно ли её воспроизвести.

Автор поэтому выступает за новый подход к машинному рассуждению, вдохновлённый AlphaGo. Вместо того чтобы просто наращивать размер моделей, системе нужно хранить явное «эпистемическое состояние»: что считается установленным, что вызывает сомнения, какие гипотезы исключены, какие вопросы остаются открытыми. Рассуждение в такой схеме становится серией действий, которые уменьшают неопределённость: вывести следствие, разбить задачу, вызвать инструмент, провести вычисление, запросить эксперимент или проверить доказательство.

Открытый мир сложнее го и шахмат. В настольной игре есть фиксированные правила, видимая доска и конечный набор ходов. В реальности состояние известно частично, действия разнообразны, последствия вероятностны, а данные часто шумные. Но современные LLM всё равно могут быть полезной частью такой системы: предлагать варианты действий, работать с API и кодом, формулировать проверки, искать слабые места в аргументации. Главное — чтобы независимый механизм оценивал каждый шаг по тому, насколько он действительно снижает неопределённость и подтверждён ли данными.

Фраза LLM не рассуждают звучит провокационно, особенно на фоне того, как уверенно они пишут код, спорят о математике и объясняют архитектуру сервисов. Но спор здесь не о том, полезны ли языковые модели. Спор о том, можно ли доверять системе, которая звучит как аналитик, но не ведёт проверяемый журнал собственных гипотез. Следующий большой скачок в ИИ может оказаться не в модели, которая говорит ещё убедительнее, а в системе, которая умеет показать, что именно она знает, почему она в этом уверена и какой вопрос задаст следующим.

Поделиться: Telegram X LinkedIn