БИЗНЕС И ЦИФРОВИЗАЦИЯ

Claude Fable 5 стал лидером нового бенчмарка Agent Arena

Claude Fable 5 от Anthropic стал лидером бенчмарка Agent Arena с результатом +11,2%, но по управляемости показал низкие результаты.

✍️ Редакция iTech News | 14.11.2025 | ⏱ 2 мин | Источник: Habr / Новости
Claude Fable 5 возглавил бенчмарк Agent Arena

Искусственный интеллект Claude Fable 5 от Anthropic возглавил новый бенчмарк Agent Arena, получив улучшение на +11,2% по сравнению со средней моделью. Однако его низкие показатели управляемости, занявшие 17-е место из 23 участников, вызывают определенные вопросы.

Контекст нового бенчмарка

Платформа Agent Arena (ранее известная как LMArena) была создана для оценки ИИ по их способности эффективно выполнять реальные рабочие задачи в агентском режиме. Новой методологии рейтинга присущи многоступенчатые задачи, включая взаимодействие с веб-поиском и файловыми системами. Это отличает Agent Arena от традиционных рейтинг-систем, основывающихся на парных сравнениях ответов.

Детали и достижения Claude Fable 5

Зафиксированный успех Claude Fable 5 особенно заметен по выполнению задач: модель набрала +18,2%, что почти вдвое больше, чем у ее ближайшего соперника Claude Opus 4.8, который продемонстрировал +9,85% в режиме рассуждений. Более того, разрыв в соотношении похвал и жалоб составил +30,6% против +15,3% у Opus 4.8.

Тем не менее, по критериям, связанным с управляемостью, Claude Fable 5 показал отрицательные результаты: -6,8% при обработке пользовательских поправок. Несмотря на это, модель занимает седьмое место по скорости восстановления после ошибок в bash.

Технические параметры исследования

Методология Agent Arena основывается на causal tracing. За неделю работы было обработано 160 480 задач, и агенты написали 40,3 миллиона строк кода. В ходе тестирования каждая третья сессия достигала контекста минимум в 128 тысяч токенов, что включает в себя сложные задания, таких как создание веб-сайтов и разработка моделей для подводных аппаратов.

Значение для рынка и разработчиков

Для разработчиков и компаний, использующих ИИ, результаты бенчмарка Agent Arena подчеркивают важность не только вычислительных мощностей, но и способности модели к управляемости. Хотя Claude Fable 5 показал лучшие результаты в решении сложных задач, узкие места в управляемости могут влиять на его практическое применение.

С интересом ждёт новую итерацию Claude, так как успех на кодировании свидетельствует о сильно растущем влиянии продуктов Anthropic на рынке AI.

Поделиться: Telegram X LinkedIn