Больше 800 регистраций из 86 городов собрал турнир BitGN PAC1 в апреле 2026 года, и это хороший маркер: агентские соревнования перестают быть экзотикой для исследователей и становятся инженерным полигоном для команд, которые строят прикладной AI. Для русскоязычного IT-рынка это важный сдвиг: теперь мало получить «правильный ответ», нужно доказать, что агент умеет действовать в среде предсказуемо, безопасно и без лишней самодеятельности.
Об этом пишет Habr / Карьера в материале Егора Спирина, руководителя лаборатории прикладных агентов AI Talent Hub при ИТМО. Его главный тезис звучит неприятно, но честно: привычная логика IT-соревнований здесь ломается. В ICPC побеждают алгоритмы и скорость, в Kaggle все упирается в метрику на фиксированном датасете. У агентных систем другая проблема: оценивается не только результат, но и весь маршрут до него — какие инструменты вызваны, сколько шагов сделано, были ли нарушены ограничения, не утекли ли данные, не сломал ли агент среду по дороге.
Из-за этого сама метрика становится сложнее. Бинарное «решил или не решил» почти бесполезно, если два агента пришли к одному ответу разной ценой: один закрыл задачу за восемь вызовов инструментов, второй сделал 47 шагов, несколько раз ошибся и добрался до финиша только после повторов. Для бизнеса разница радикальная. Первый похож на продукт, который можно выпускать в прод, второй — на стажера, которому нельзя давать доступ к CRM без присмотра. К этому добавляется еще одна проблема: вместо больших датасетов нужны сценарии поведения, а собирать их заметно тяжелее. Наконец, агент работает не в вакууме: он общается через API, редактирует файлы, ведет диалог. Если что-то пошло не так, еще нужно отделить ошибку модели от сбоя среды.
На примере BitGN PAC1 это видно особенно хорошо. Соревнование было построено вокруг персонального агента по имени Майлс, который должен разбираться с файлами, письмами, счетами, заметками по проектам и контактами, а заодно переживать промпт-инъекции и попытки социальной инженерии. Ключевой момент в том, что платформа оценивала не текст, а реальные действия агента: какие инструменты он вызывал, что менял, какие побочные эффекты создавал и нарушал ли правила. Среда при этом была детерминированной: каждый прогон стартовал из одного и того же состояния. Если агент падал, это уже не удобно списать на «стохастику LLM», а приходится разбираться с архитектурой.
Один из участников, студент AI Talent Hub Максим Пискарев, собрал одноагентную skill-based ReAct-систему на OpenAI Agents SDK с моделью gpt-4o-mini. Базовая схема выглядела довольно рационально: принять задачу, классифицировать ее по нужному навыку, пройти цикл «действие — вызов инструмента — наблюдение — следующий шаг», а затем закрыть задачу через submit_answer. Но споткнулась система не там, где обычно ждут беды. Проблемой оказались не инъекции и не сложные цепочки tool calls, а контакты с одинаковыми именами в CRM. По правилам агент не должен был просить уточнение, а обязан был сам выбрать верного человека по контексту — аккаунту, заметкам и compliance-флагам. Встроенный guardrail безопасного поведения, наоборот, толкал его в clarification, и задача проваливалась. Еще показательнее другой сбой: агент иногда формально завершал шаг вообще без tool calls и без финальной отправки ответа. Снаружи это выглядело почти как случайность, но по логам оказалось банальной инженерной дырой. Вывод для любой команды, строящей AI-агентов, довольно жесткий: полагаться только на модель нельзя, нужны страховки на уровне оркестратора — retry, force-submit и контроль того, что задача действительно закрыта корректным протоколом.
Второй турнир, AgentBeats, показал уже другую крайность. Здесь бенчмарк сам превращается в агента: один агент играет роль оценщика и пользователя, второй — участника, который должен довести диалог до правильного исхода. Общение идет по A2A-протоколу, без участия человека. Несколько участников из AI Talent Hub выбрали для этого τ²-bench от Sierra Research — бенчмарк для оценки клиентских AI-агентов. Его сложность в том, что оба участника диалога имеют доступ к инструментам и могут менять состояние общей системы. В треке авиакомпании это означало работу с бронированиями, возвратами и апгрейдами, где правила важнее красноречия: некоторые билеты нельзя менять вообще, где-то нельзя менять направление рейса, где-то нужно корректно обработать сертификат или апгрейд. Ошибся в политике — задача сразу провалена, даже если диалог выглядел убедительно.
Здесь всплывает еще один неприятный для индустрии факт: когда судья тоже LLM, стабильность результата становится отдельной задачей. По словам студента Владислава Кинякина, агент-оценщик был недетерминированным, с температурой около 1.0, поэтому один и тот же код на разных прогонах давал разные результаты. В одном случае «пользователь» спокойно формулировал запрос, в другом спорил, давил на жалость или пытался манипулировать. Если агент начинал чрезмерно угождать собеседнику или уходил в болтовню, он срывался в нарушение политик. Отсюда меняется и стратегия разработки: оптимизировать нужно не только под тест-кейс, но и под устойчивость поведения в токсичном, шумном и намеренно сбивающем диалоге. Другой участник, Павел Соколов, при этом справедливо замечает, что метрика никуда не делась: если есть набор правил, инструменты и целевое состояние, задача все равно сводится к тому, чтобы дойти до него надежнее конкурентов. Просто теперь надежность и есть часть метрики, а не фоновое пожелание.
Для разработчиков и продуктовых команд из этого следует довольно практичный вывод. Агентские соревнования все больше похожи не на олимпиаду по моделям, а на стресс-тестирование реальных AI-систем. Побеждает не тот, кто написал самый эффектный промпт, а тот, кто собрал внятный протокол исполнения, предусмотрел сбои, зафиксировал ограничения и научил агента не вредить, когда среда или собеседник ведут себя нестандартно. Для HR и руководителей это тоже полезный сигнал: компетенция «умеет работать с LLM» уже не исчерпывается промптами и выбором модели. Нужны инженеры, которые понимают оркестрацию, логи, политики доступа, состояние среды и поведенческое тестирование.
Если тренд сохранится, то в ближайшие годы именно агентские соревнования станут для рынка тем, чем когда-то были Kaggle и ICPC: местом, где видно не презентацию технологии, а ее пределы. И тогда главным вопросом для команд будет уже не «насколько умный наш агент», а «можно ли доверить ему задачу, где цена лишнего шага выше, чем красивый демо-ролик».