Модели GPT-5.5 от OpenAI и Opus 4.7 от Anthropic провалились в тестах на интеллект, продемонстрировав результаты 0,43% и 0,18% соответственно в сравнении с 100% у людей. Эти данные важны, так как показывают текущее состояние AI-технологий и их ограничения.
Что такое ARC-AGI-3?
ARC Prize Foundation провёл тестирование моделей на бенчмарке ARC-AGI-3, который был запущен в марте 2026 года. Это интерактивный тест, состоящий из сотен уникальных сред, созданных вручную геймдизайнером, где модели должны самостоятельно определить правила игры и стратегии. Такого рода тесты необходимы для оценки способностей AI адаптироваться к непредсказуемым сценариям.
Как прошли тесты?
В ходе анализа было выделено три основных паттерна ошибки моделей. Во-первых, они не смогли вывести общие правила из наблюдений. Например, GPT-5.5 замечала, что нажатие на кнопку поворачивает объект, но не сформулировала стратегию, как это использовать во благо. Во-вторых, модели часто применяли старые наработки к новым задачам, что приводило к неправильным выводам. Так, Opus ошибочно полагала, что клик — это телепортация героя, что в итоге привело к провалу на втором уровне.
Что это значит для ИТ-отрасли?
Эти результаты важно учитывать для разработчиков и бизнеса. Текущие модели AI, хоть и показывают высокие технологии в теории, на практике сталкиваются с серьёзными ограничениями. В частности, если ваши проекты завязаны на самонавчающиеся машины, нужно понимать: их поведение во многом предсказуемо и подвержено ошибкам в новых условиях. Инвестиции в AI-продукты могут быть рискованными, особенно если они не обеспечивают должной адаптивности к новым реальностям.
Краткосрочный прогноз невесёлый: если текущие модели не преодолеют эти барьеры, то их применение в реальных задачах останется под вопросом.