БИЗНЕС И ЦИФРОВИЗАЦИЯ

GPT-5.5 и Opus 4.7 провалились в тестах ARC-AGI-3 — результаты ниже 1%

Модели AI от OpenAI и Anthropic провалились на бенчмарке ARC-AGI-3, продемонстрировав результаты 0,43% и 0,18% соответственно.

✍️ Редакция iTech News | 26.12.2025 | ⏱ 2 мин | Источник: Habr / Новости
💸

Модели GPT-5.5 от OpenAI и Opus 4.7 от Anthropic провалились в тестах на интеллект, продемонстрировав результаты 0,43% и 0,18% соответственно в сравнении с 100% у людей. Эти данные важны, так как показывают текущее состояние AI-технологий и их ограничения.

Что такое ARC-AGI-3?

ARC Prize Foundation провёл тестирование моделей на бенчмарке ARC-AGI-3, который был запущен в марте 2026 года. Это интерактивный тест, состоящий из сотен уникальных сред, созданных вручную геймдизайнером, где модели должны самостоятельно определить правила игры и стратегии. Такого рода тесты необходимы для оценки способностей AI адаптироваться к непредсказуемым сценариям.

Как прошли тесты?

В ходе анализа было выделено три основных паттерна ошибки моделей. Во-первых, они не смогли вывести общие правила из наблюдений. Например, GPT-5.5 замечала, что нажатие на кнопку поворачивает объект, но не сформулировала стратегию, как это использовать во благо. Во-вторых, модели часто применяли старые наработки к новым задачам, что приводило к неправильным выводам. Так, Opus ошибочно полагала, что клик — это телепортация героя, что в итоге привело к провалу на втором уровне.

Что это значит для ИТ-отрасли?

Эти результаты важно учитывать для разработчиков и бизнеса. Текущие модели AI, хоть и показывают высокие технологии в теории, на практике сталкиваются с серьёзными ограничениями. В частности, если ваши проекты завязаны на самонавчающиеся машины, нужно понимать: их поведение во многом предсказуемо и подвержено ошибкам в новых условиях. Инвестиции в AI-продукты могут быть рискованными, особенно если они не обеспечивают должной адаптивности к новым реальностям.

Краткосрочный прогноз невесёлый: если текущие модели не преодолеют эти барьеры, то их применение в реальных задачах останется под вопросом.

Поделиться: Telegram X LinkedIn