AI-агенты OpenAI уже генерируют 3,1 «агентодня» на каждый рабочий день человека в исследовательской организации компании. Звучит как победа автоматизации, но главный вывод менее удобный: чем больше задач выполняют агенты, тем больше работы появляется у людей, которые должны все это проверять, направлять и останавливать, пока оно не уехало в прод.
OpenAI заявила, что достигла цели, поставленной прошлой осенью: исследователи компании теперь используют то, что внутри называют «автоматизированным исследовательским интерном», сообщает The New Stack. Речь не о магическом сотруднике без зарплаты, а об агенте для хорошо описанных задач, которые у квалифицированного исследователя заняли бы несколько дней. По данным компании, к середине августа 2026 года использование coding-агентов заметно выросло, а медианный исследователь тратил на инференс более 600 долларов в день по API-ценам. У сотрудников из 90-го перцентиля расходы превышали 7000 долларов в день.
Ключевая оговорка спрятана в самой метрике. «Агентодень» OpenAI считает как восемь часов работы агента, но это не равно одному дню человеческого прогресса. Исследователь может запускать несколько агентов параллельно, агенты могут плодить подзадачи, писать код, гонять эксперименты и собирать артефакты. На графике это выглядит как резкий рост производительности. В реальности рядом появляется новая очередь: проверить diff, понять, не ушел ли эксперимент в сторону, выбрать полезный результат, отбросить мусор, перепоставить задачу.
OpenAI разложила работу агентов по таксономии Epoch AI на шесть типов: выбор направления, проектирование, сборка, запуск, анализ и коммуникация. С января по август активность выросла во всех шести категориях. Но в самой важной зоне — решении, какую исследовательскую задачу вообще стоит брать, — агенты пока участвуют заметно меньше. Это неприятная, но знакомая картина для инженерных команд: автоматизировать выполнение проще, чем автоматизировать постановку правильной цели.
Практическая польза при этом есть. Агенты пишут исследовательский и инфраструктурный код, следят за экспериментами, помогают в отладке. OpenAI утверждает, что посещаемость debugging office hours снизилась настолько, что одна команда вообще перестала проводить такие сессии. Для разработчиков это понятный сценарий: часть рутины действительно уходит в фон, особенно там, где задача хорошо формализована и результат можно быстро прогнать через тесты, логи или метрики.
Но рынок уже упирается не в способность модели «что-то сделать», а в способность организации это безопасно принять. OpenAI признает: количество написанного кода и число экспериментов считать легко, но эти показатели плохо отвечают на вопрос, ускорилось ли само исследование. Компания использовала отдельную модель для оценки успешности задач разной сложности и увидела прогресс с января по июль. Однако даже среди успешных задач, которые человеку заняли бы четыре-восемь часов, людям все равно приходилось вмешиваться более чем в половине случаев.
Именно здесь AI-агенты OpenAI превращаются из истории про экономию времени в историю про операционную нагрузку. Когда один инженер ведет не одну задачу, а несколько параллельных агентных веток, он становится диспетчером. Нужно держать контекст, читать промежуточные выводы, сверять изменения с архитектурой, ловить ошибки безопасности и решать, какие результаты достойны дальнейшего использования. Это уже не классическое «модель написала код за меня». Это мини-платформа производства задач, где человек отвечает за качество.
Инфраструктурный риск тоже перестал быть теорией. 20 июля серия сбоев, вызванных агентами, нарушила работу исследовательской инфраструктуры OpenAI настолько, что компания временно отключила training container service, а затем вернула его с более жесткими ограничениями. 7 августа доступ снова ужесточили: ранние признаки показали, что Astra может приблизиться к уровню Critical в Preparedness Framework компании. После этого возможности модели ограничили более защищенными исследовательскими зонами и добавили дополнительные меры контроля.
Показательно, что ограничения не остановили спрос. После ужесточения доступа GPU-аллокация для Astra-класса упала на 59,2% за неделю, но нагрузка быстро переехала на другие модели. Их GPU-аллокация выросла на 17,2% и компенсировала примерно 85% падения использования Astra. Для бизнеса это важный сигнал: если процесс уже привык к агентам, команда не обязательно возвращается к ручной работе. Она ищет другой путь, иногда менее удобный, иногда менее мощный, но продолжает гнать задачи через автоматизацию.
Для русскоязычных IT-команд вывод довольно приземленный. Перед внедрением агентов стоит считать не только «сколько задач они закрыли», но и стоимость ревью, число отклоненных изменений, время человека на постановку задач, инциденты, перерасход compute и задержки из-за проверок безопасности. Иначе в отчете будет красивая автоматизация, а в Jira — новая очередь из артефактов, которые кто-то должен разобрать. Следующий рубеж для AI-агентов OpenAI и их конкурентов — не просто писать больше кода или запускать больше экспериментов, а уменьшать объем человеческого надзора на единицу полезного результата. Пока именно надзор выглядит главным дефицитом, а не генерация.
