23,9% задач — лучший результат, который показал Claude Opus 5 в новом тесте для агентов, строящих других агентов. Бенчмарк Hyper-τ-bench от Sierra проверяет не красивый демо-чат, а способность AI-разработчика собрать рабочего customer service-агента под ограничения бизнеса, бюджета и скрытых требований. Для команд, которые уже примеряют Claude Code, Codex и похожие инструменты к реальным процессам, вывод неприятно практичный: код они писать умеют, но инженерное чутьё пока не поставляется в коробке.
Sierra открыла Hyper-τ-bench в начале сентября, сообщает The New Stack. Компания знакома рынку enterprise-AI: её соосновал Брет Тейлор, бывший сопредседатель Salesforce и нынешний председатель совета директоров OpenAI. Новый тест продолжает τ-bench 2024 года, но меняет уровень абстракции. Если прежний бенчмарк оценивал уже готового агента — как он разговаривает с пользователем, вызывает инструменты и соблюдает политики компании, — то Hyper-τ-bench смотрит на предыдущий этап: может ли AI-агент сам построить такого агента.
Сценарий выглядит близко к тому, что продают корпоративным клиентам почти все поставщики агентных платформ. Разработчику-агенту дают материалы условного бизнеса: документы, транскрипты, API, кодовую базу. Его задача — собрать customer service-агента, который затем проходит проверки на неизвестных заранее диалогах. Домены тоже без фантастики: авиаперевозки, ретейл, телеком и банки. В тестах агент должен, например, отменить рейс, разобраться с комиссией или изменить запись в системе, а не просто уверенно пересказать политику возвратов.
В первой серии Sierra протестировала шесть сочетаний модели и coding harness. В набор попали модели Anthropic в Claude Code, модели OpenAI в Codex, а также Kimi от Moonshot AI в Kimi Code и OpenCode. Лучшим оказался Claude Opus 5 в Claude Code — 23,9% успешных прогонов. Конфигурация OpenAI в Codex шла рядом с 22%. Ни один автономный вариант не добрался даже до четверти задач. Для маркетинговых слайдов это слабовато; для исследовательского бенчмарка, наоборот, полезно: остаётся пространство, где можно измерять прогресс, а не раздавать всем медали за 98%.
Самая показательная планка — не победа Claude, а разрыв с эталоном Human + AI reference: 82,2%. Но эту цифру нельзя читать как простое доказательство, что человек утраивает эффективность. Sierra прямо оговаривает: это скорее oracle reference. Референсных агентов собирал автор бенчмарка с помощью frontier-модели и с доступом к ground-truth требованиям, которые автономные агенты должны были выявить сами. То есть сравнение честно показывает потолок в условиях с глубоким контекстом, но не среднюю производительность обычного инженера после третьего созвона с заказчиком.
Разброс по доменам оказался жёстким. Claude Opus 5 набрал 72,8% в ретейле, 55,9% в авиасценариях и 48,2% в телекоме, но в банковских задачах рухнул до 5,9%. У конфигурации OpenAI в Codex банковский результат был чуть выше — 9%, что всё равно не повод открывать шампанское. Банки в Hyper-τ-bench — самая тяжёлая часть: 35 из 53 задач, около 2 969 отдельных фактов в политиках, а одна задача может зависеть от 580 условий. Иными словами, агенту нужно не просто найти один релевантный PDF, а собрать картину из множества правил, исключений и зависимостей.
Главная проблема оказалась не в синтаксисе и не в том, что модель не смогла вызвать API. Разработчики-агенты слишком рано прекращали исследование, открывали мало файлов, редко задавали уточняющие вопросы и почти не перебирали архитектуры. В банковском домене они просматривали меньше 80 файлов из примерно 1 700 доступных, полагаясь на поиск по документам. Это похоже на человеческую ошибку, знакомую любому тимлиду: инженер нашёл три похожих артефакта, решил, что понял предметную область, и пошёл писать реализацию.
Особенно плохо агенты пользовались правом задавать вопросы бизнесу. По данным Sierra, такие обращения составили всего 0,3% вызовов инструментов. На некоторых задачах от 20 до 25 требований можно было выявить только через вопросы, но агенты задавали не больше четырёх. Эффект был измеримым: на задачах, где экспертный эталон набирал 95-100%, сборки без вопросов получали около 5%; после одного вопроса результат рос до 15%, после двух — до 25%. Это хороший холодный душ для идеи, что агенту достаточно закинуть папку с регламентами и попросить «собрать всё как надо».
Бюджет тоже подвёл. Hyper-τ-bench ограничивает расходы готового customer service-агента на модельные вызовы во время диалога. Две сборки вышли за лимит — в 3 раза и в 1,3 раза — и получили ноль после штрафов. Большинство, наоборот, недоиспользовало доступные ресурсы: среди конфигураций, уложившихся в лимит, средний расход составил лишь 45% разрешённого бюджета. Для бизнеса это знакомая дилемма: агент должен быть не только умным, но и экономически предсказуемым. Слишком дорогой агент не проходит закупку, слишком дешёвый может не пройти задачу.
Архитектурное разнообразие оказалось почти декоративным. 92% сборок выбрали схему single LLM tool loop: одна модель по кругу решает, отвечать пользователю или вызвать инструмент. В одном телеком-эксперименте Sierra добавила всего одно предложение с подсказкой про альтернативную архитектуру, и результат вырос с 31% до 67%. Это не доказывает, что конкретная схема всегда лучше, зато показывает другое: автономные агенты редко ведут себя как хорошие инженеры на этапе проектирования. Они находят рабочий путь и слишком быстро объявляют его достаточным.
Для разработчиков практический вывод прост: агент, который строит агента, пока требует не меньше product thinking, а иногда даже больше. Нужно явно заставлять его читать корпус требований, задавать вопросы, запускать симуляции, сравнивать архитектуры и учитывать стоимость инференса. Для CIO и продактов это аргумент против режима «отдадим агентам весь процесс и сократим контроль». Гораздо реалистичнее выглядит гибридная схема: AI собирает черновик, генерирует тесты и быстро чинит найденные ошибки, а человек остаётся владельцем требований, критериев качества и допуска в прод.
Бенчмарк Hyper-τ-bench интересен именно потому, что бьёт по удобной иллюзии: если модель пишет код, значит, она уже умеет делать инженерный продукт. Пока результаты говорят другое. Следующая гонка в AI-агентах будет не только за лучшие модели, но и за инструменты, которые научат их задавать неудобные вопросы до релиза, а не после инцидента в саппорте; подробности исследования разобрал .