Лучшие языковые модели уже умеют писать код, резюмировать документы и проходить часть профессиональных тестов, но на простых с виду головоломках регулярно ломаются. Именно поэтому тесты для ИИ все чаще показывают не красивую демо-обложку, а реальный профиль ограничений моделей, и для разработчиков с продактами это куда полезнее очередного рекламного бенчмарка.
Как пишет MIT Technology Review, игры и пазлы были частью AI-исследований с самого начала: термин machine learning закрепился еще после статьи IBM-исследователя Артура Самуэля 1959 года о программе для шашек. Шахматы и го давно стали классическими полигонами для проверки машинного интеллекта, но теперь набор испытаний шире: от визуальных задач на вращение объектов до логических головоломок и задач на перенос правил. Картина выходит неровная: прогресс быстрый, но неравномерный, и как раз это делает тесты для ИИ полезным инструментом, а не развлечением для техноэнтузиастов.
Самый показательный пример из материала связан с пазлами Connections из The New York Times. В конце 2024 года команда ученых из Columbia University показала, что даже лучшие модели могли правильно решать лишь 18% таких задач. Уже к началу 2025 года некоторые модели, по данным издания, добрались почти до безошибочного результата. На бумаге выглядит как очередной скачок интеллекта. На практике это хороший повод не путать улучшение на конкретном формате с устойчивым ростом способности рассуждать. Если модель научилась почти идеально проходить популярный тип головоломки за считаные месяцы, у команды должны возникнуть вопросы: это действительно обобщение, или система просто стала лучше воспроизводить знакомый шаблон?
Одна из самых болезненных зон для моделей, по версии MIT Technology Review, это пространственное мышление. Речь о задачах, где нужно мысленно поворачивать трехмерный объект и распознавать его под другим углом. Для человека с инженерным, архитектурным или просто развитым визуально-пространственным мышлением это базовое упражнение. Для LLM, даже мультимодальных, до сих пор нет. Модели плохо манипулируют 3D-представлениями, хотя индустрия уже довольно давно обсуждает world models и обещает системам более глубокое понимание физического мира. Это неприятный сигнал для всех, кто хочет без оглядки доверять AI в сценариях, связанных с CAD, робототехникой, промышленным дизайном, визуальной инспекцией и инженерным анализом. Генерировать объяснение про объект и действительно понимать его форму, как выясняется, не одно и то же.
Не менее интересно модели проваливаются там, где у них вроде бы есть преимущество, то есть в памяти. У frontier-LLM огромный запас фактов из обучения, и именно он иногда мешает. В материале приводится исследование 2024 года от Google и University of Illinois Urbana-Champaign: модели тестировали на слегка измененных вариантах классических задач Knights and Knaves, где нужно вычислить, кто всегда говорит правду, а кто всегда лжет. Выяснилось, что малейшие вариации сбивают систему с толку. Похожий эффект обнаруживается и в наборе SimpleBench: вопросы выглядят как сложные логические задачи, но на деле проверяют внимательное чтение и устойчивость к ловушкам. Человек часто замечает подвох сразу. Модель же может уверенно выдать ответ на основе заученного паттерна, проигнорировав ключевую деталь. Для бизнеса вывод прямой: если ваш AI-помощник работает с договорами, тикетами, спецификациями или инцидентами, проблема не только в галлюцинациях. Есть еще и более скучный, но опасный класс ошибок: система видит знакомую структуру и слишком рано решает, что уже все поняла.
Отдельный сюжет касается абстрактного и визуального вывода. В ARC-AGI, одном из самых известных пазл-бенчмарков, моделям нужно понять правило преобразования сетки по нескольким примерам и применить его к новому случаю. Здесь AI тоже спотыкается, причем не только из-за сложности задачи, но и из-за самого способа представления данных. По данным MIT Technology Review, модели справляются лучше, когда получают сетку не как изображение, а как строку чисел, кодирующую цвет ячеек. То есть для машины картинка иногда оказывается лишней помехой. Еще важнее другое: исследования показывают, что даже при правильном ответе модель нередко приходит к нему через слишком запутанные и плохо переносимые эвристики, тогда как человек обычно опирается на простую визуальную идею. Для команд, которые строят продукты на LLM, это почти готовое правило проектирования: хороший результат на бенчмарке еще не гарантирует, что механизм решения устойчив, объясним и перенесется на соседний класс задач.
Но материал не сводится к привычному тезису про глупый AI. Люди тоже регулярно ошибаются, просто по-другому. Психологи давно используют задачи, где человек дает интуитивный, но неверный ответ, а модель, наоборот, может справиться за счет более медленного и буквального разбора вопроса. MIT Technology Review приводит примеры из такого lightning round: задача про колонию летучих мышей, численность которой удваивается каждый день, и вопрос с заведомо сбивающей формулировкой про Алису. Это полезное напоминание для индустрии: сравнение человека и модели редко бывает линейным. У нас лучше развиты интуиция, перенос в физический мир и чувствительность к контексту. У машин сильнее дисциплина перебора, память и устойчивость к некоторым когнитивным ловушкам. Поэтому разговоры в духе "ИИ умнее человека" или "ИИ вообще ничего не понимает" одинаково плохо описывают реальность.
Наконец, есть и проблема масштаба. Исследование Apple, которое цитирует издание, показало: языковые модели могут уверенно решать упрощенные версии Tower of Hanoi и задач на переправу через реку, но начинают сыпаться, когда число дисков или участников доходит до шести и выше. Похожую слабость исследователи из University of Washington, Stanford University и Allen Institute for AI наблюдали в логических grid puzzles. Для прикладной разработки это, пожалуй, самый практичный вывод из всей истории. Модель может красиво пройти демо на трех шагах и развалиться на шестом, когда возрастает глубина состояния, число ограничений или объем промежуточных зависимостей. А именно это обычно и происходит в проде: чуть больше сущностей, чуть длиннее цепочка условий, чуть меньше права на ошибку.
Тесты для ИИ в виде головоломок хороши не тем, что из них можно собрать очередной рейтинг моделей, а тем, что они вскрывают разницу между запоминанием, распознаванием шаблона и настоящим переносом навыка. Для русскоязычных команд, которые внедряют AI в продукты, аналитику и разработку, урок довольно приземленный: смотреть нужно не только на средний балл в отчете, но и на типы задач, где система ломается, на цену такой ошибки и на то, растет ли качество вместе со сложностью. Похоже, ближайшая конкуренция в AI будет идти не за самый эффектный ответ, а за способность модели не терять нить рассуждения там, где головоломка чуть-чуть отличается от вчерашней.