AI И НЕЙРОСЕТИ

OpenAI показала, как дообучать ИИ-агентов через RL и инструменты

OpenAI представила Agent RFT — подход к дообучению ИИ-агентов через RL, вызовы инструментов и кастомные награды для бизнеса.

✍️ Редакция iTech News | 04.07.2026 | ⏱ 5 мин | Источник: InfoQ
🔮

OpenAI продвигает дообучение ИИ-агентов не через новые промпты, а через reinforcement learning с доступом к инструментам и собственной функцией награды. Для разработчиков и продуктовых команд это важный сдвиг: если агент уже умеет «почти все», но все еще зацикливается, тратит лишние токены и ошибается на длинном хвосте кейсов, компания предлагает лечить это не очередным prompt engineering, а тренировкой на реальных траекториях работы.

Об этом на QCon AI рассказали сотрудники OpenAI Wenjie Zi и Will Hang, сообщает InfoQ. Доклад был посвящен Agent RFT — платформенному подходу OpenAI к настройке reasoning-моделей через взаимодействие с инструментами в реальном времени и кастомные reward-сигналы. Смысл в том, что агент оценивается не только по финальному ответу, но и по цепочке действий внутри контекстного окна: какие инструменты он вызывал, что передавал в них, что получил обратно и сколько лишних шагов сделал по дороге.

В OpenAI отдельно подчеркивают: агент в их понимании отличается от обычной модели тем, что умеет действовать во внешней среде без постоянного участия человека. Для кодового агента это терминал, интерпретатор и кодовая база. Для саппорт-агента — доступ к CRM, биллингу, внутренним системам и маршрутизации на человека. Все эти обращения к инструментам возвращаются обратно в context window, и именно здесь, по словам докладчиков, возникает одна из самых неприятных инженерных проблем: credit assignment. Проще говоря, если агент в конце завалил задачу, нужно понять, где именно он свернул не туда — в рассуждении, выборе инструмента, параметрах вызова или интерпретации результата.

На этом месте OpenAI аккуратно разводит два класса дообучения. Первый — supervised fine-tuning, знакомый большинству команд по API и задачам вроде классификации, суммаризации, перевода или стилистического выравнивания. Там модель учат воспроизводить нужный ответ по размеченным примерам, и этот подход хорошо работает, когда правильный выход относительно стабилен и предсказуем. В докладе приводится понятный корпоративный пример: суммаризация финансовых документов вроде S-1 или 10-K, где модель должна стабильно вытаскивать выручку, маржу и другие существенные показатели. Второй класс — reinforcement learning, который лучше подходит для задач, где важен не только ответ, но и путь к нему, особенно если агент работает с инструментами, ветвится и принимает серию промежуточных решений.

С практической точки зрения это выглядит как попытка закрыть потолок, в который многие команды уже уперлись. Обычно улучшение агента начинается не с обучения, а с более дешевых мер: оптимизации системного промпта, упрощения задачи, добавления guardrails, пересборки набора инструментов, улучшения их описаний и качества самих tool outputs. OpenAI этого не отрицает и прямо говорит: сначала выжимайте максимум из prompt optimization и дизайна инструментов. Но если после этого агент все еще нестабилен, тогда и начинается разговор про дообучение ИИ-агентов на реальных сценариях.

Самый интересный тезис из доклада — обещание убрать long-tail token loops, то есть длинные бессмысленные циклы рассуждений и вызовов, в которые агенты иногда падают на редких или плохо формализованных кейсах. Для enterprise-заказчиков это не академическая мелочь, а вполне приземленная статья расходов. Каждая лишняя итерация — это задержка, рост стоимости инференса и риск того, что агент вместо решения задачи просто красиво сожжет бюджет. Докладчики утверждают, что Agent RFT помогает убрать такие хвосты и добиться «экстремальной эффективности», хотя конкретные проценты, деньги или бенчмарки в пересказе InfoQ не приводятся. Это важная оговорка: пока речь скорее о направлении и архитектурной логике, чем о наборе публичных KPI, которые можно сразу занести в квартальный план.

Отдельный слой — позиционирование самих агентов OpenAI. В качестве примеров компания называет Codex и Deep Research. Codex, по описанию докладчиков, работает как агент с доступом к shell-командам, планированию, чтению файлов, запуску тестов и внесению изменений в код. Deep Research опирается на браузер и документы файловой системы. Это не просто маркетинговая вставка, а попытка показать, что OpenAI обкатывает ту же логику на собственных продвинутых агентах: модель должна не только «знать», но и последовательно действовать в среде, где почти каждое действие оставляет след в контексте и влияет на следующее.

Для русскоязычной IT-аудитории здесь несколько практических выводов. Во-первых, дообучение ИИ-агентов постепенно превращается из красивой исследовательской формулы в инженерный инструмент для продуктовых задач. Во-вторых, ценность смещается от коллекции промптов к качеству среды: насколько чисто описаны инструменты, насколько хорошо размечены успешные и провальные траектории, насколько внятно бизнес вообще понимает, что считать наградой. Если CRM-агент «решил вопрос» за 12 шагов, а другой за 3, формально оба могут быть правы, но для RL это уже принципиально разные истории. В-третьих, это еще один сигнал, что рынок движется от single-turn usage к агентным контурам, где считать придется не только качество ответа, но и стоимость всей цепочки действий.

Есть и более неприятный, но полезный вывод: многие корпоративные команды пока не готовы к такому уровню настройки. Reinforcement learning для агентных систем требует не только модели, но и дисциплины вокруг логирования, оценки траекторий, построения reward-функций и контроля побочных эффектов. Иначе можно очень технично дообучить систему на не тот сигнал. Если коротко, плохой промпт портит один ответ, плохая награда может испортить поведение целого класса агентов.

Следующий этап конкуренции в AI, похоже, будет идти не за самую громкую модель, а за самую управляемую агентную систему. Если тезисы OpenAI подтвердятся на публичных кейсах с цифрами, рынок быстро перейдет от разговоров про «умнее отвечает» к более скучному, но куда более дорогому вопросу: кто умеет надежно доводить задачу до конца, не устраивая дорогостоящий токенный сериал из 20 серий.

Поделиться: Telegram X LinkedIn