АНАЛИТИКА

Новый бенчмарк AI-агентов проверяет не чат, а реальную работу

2,6% — средний полный pass rate в Agents’ Last Exam, бенчмарке AI-агентов на 1000+ рабочих задач. Почему рынок уходит от старых метрик.

✍️ Редакция iTech News | 16.06.2026 | ⏱ 4 мин | Источник: The New Stack
💰

Средний полный pass rate в новом Agents’ Last Exam составляет всего 2,6%, хотя индустрия уже привыкла к громким победам моделей в тестах по математике, коду и рассуждению. Для русскоязычной IT-аудитории это важный сигнал: бенчмарк AI-агентов начинает смещаться от красивых демо к задачам, за которые компании реально платят.

Об этом сообщает The New Stack, разбирая бенчмарк Agents’ Last Exam, или ALE. Его идея проста и довольно неудобна для рынка: если модель показывает отличные результаты в абстрактных тестах, но не тянет длинные рабочие процессы с проверяемым итогом, то мерили мы, мягко говоря, не то. Авторы ALE прямо формулируют проблему: успехи ИИ в привычных бенчмарках пока слабо конвертируются в экономически значимое внедрение в профессиональных областях.

Собственно, ALE и задуман как попытка закрыть этот разрыв. Это не набор коротких вопросов с правильным ответом в конце, а система оценки AI-агентов на длинных, приближенных к реальной работе задачах с верифицируемым результатом. Бенчмарк создавался вместе с более чем 250 отраслевыми экспертами. Он охватывает свыше 1000 задач, распределенных по 55 поднаправлениям и 13 отраслевым кластерам. В основу структуры легла классификация O*NET / SOC 2018, то есть американская таксономия профессий и видов занятости. Переводя с исследовательского на рабочий язык: авторы пытаются проверять не «умеет ли модель ответить», а «умеет ли агент дотащить полезную работу до конца».

Именно это делает бенчмарк AI-агентов особенно интересным для тех, кто отвечает не за хайп, а за бюджет. Разработчикам и AI-инженерам он подсказывает, что главная проблема теперь не только в качестве базовой модели, но и в способности системы удерживать контекст, планировать действия, использовать инструменты и не разваливаться на длинной дистанции. Для продактов и IT-директоров вывод еще прямее: лидерборды с привычными очками все хуже предсказывают, окупится ли агент в реальном процессе. Можно собрать эффектное демо, которое бодро решает задачки из бенчмарка, а потом внезапно выяснить, что в живом бизнес-процессе оно ломается на третьем шаге, забывает промежуточные условия и уверенно несет чепуху в финальный отчет.

Контекст здесь тоже показательный. Последние пару лет рынок ИИ жил в логике «новая модель побила старую модель на таком-то наборе тестов». Это было удобно для маркетинга, для инвесторов и для тех, кто любит сравнивать одну цифру с другой. Но с агентными системами такой фокус работает все хуже. Чем длиннее задача и чем ближе она к настоящей офисной или аналитической работе, тем меньше пользы от тестов, заточенных на одиночные ответы. ALE, судя по описанию, как раз и появляется в момент, когда индустрия начинает понимать: между хорошим LLM-ответом и выполненной работой лежит неприятно длинная дистанция.

На этом фоне цифра в 2,6% выглядит почти отрезвляюще. Авторы подчеркивают, что самый сложный уровень задач далек от насыщения: средний полный pass rate across mainstream harness and backbone configurations остается крайне низким. И это, пожалуй, главный практический вывод из всей истории. Не в том смысле, что AI-агенты «провалились». Скорее, в том, что рынок наконец получает более честную линейку. Если мерить системы по экономически ценным и длинным рабочим сценариям, оказывается, что до полноценной автоматизации беловоротничковых процессов еще далеко. Для одних компаний это повод не завышать ожидания. Для других — шанс трезво понять, где агент уже полезен как помощник, а где пока остается дорогой игрушкой с хорошим пиаром.

Есть и еще один важный нюанс. ALE описывается как living benchmark, то есть «живой» бенчмарк, который будет расширяться по мере добавления новых рабочих процессов и отраслей. Это логичный ход: как только фиксированный тест становится популярным, модели и обвязки начинают оптимизировать под него почти спортивным способом. В результате метрика снова рискует потерять связь с реальной работой. Живой формат сложнее, дороже и менее удобен для красивых маркетинговых таблиц, зато лучше отражает то, как на самом деле меняются задачи в бизнесе. Для рынка это неприятная, но полезная новость: эпоха, когда можно было впечатлить всех одной цифрой в презентации, похоже, заканчивается.

Для российской и русскоязычной IT-практики история с ALE интересна сразу на нескольких уровнях. Во-первых, она дает более вменяемую рамку для пилотов с AI-агентами: оценивать нужно не только качество ответов, но и процент доведенных до конца задач, число ошибок на длинной цепочке и стоимость получения результата. Во-вторых, она меняет разговор внутри команд. Если раньше спорили, какая модель «умнее», то теперь гораздо полезнее обсуждать, какие процессы вообще подходят для агентного режима и где нужны строгая верификация, человеческий контроль и ограничения на автономность. В-третьих, такой бенчмарк AI-агентов может стать аргументом против завышенных KPI сверху, когда от команды ждут почти магического роста продуктивности только потому, что на рынке снова появился очередной «самый умный» AI-сервис.

Главный вопрос теперь не в том, кто выиграет следующий тест на рассуждение, а в том, какая система первой научится стабильно закрывать длинные, дорогие и проверяемые рабочие сценарии. Если эта логика закрепится, индустрии придется куда меньше говорить о впечатляющих баллах и куда больше — о том, сколько реальной работы агент действительно сделал. Подробнее о самом бенчмарке и его контексте пишет The New Stack.

Поделиться: Telegram X LinkedIn