Stripe провел бенчмарк AI-агентов с целью оценить их способность создавать интеграции с реальными данными и процессами. Результаты показали, что в задачах автоматизированной интеграции на уровне API эти агенты добиваются успешности до 92%, но проблемы с валидацией все еще остаются серьезным препятствием на пути к их широкому применению.
Важность нового бенчмарка
В ходе тестирования использовались 11 реплицируемых сред для моделирования интеграций Stripe. Эти среды были сфокусированы на сценариях, критичных для финансовых систем, где ошибка может привести к значительным потерям. Агенты оценивались по задачам как на стороне бэкенда, так и полностековым процессам, включая интерфейсы браузеров.
Статьи о результатах тестирования опубликованы в блоге Stripe. В частности, результаты различаются в зависимости от задач: в интеграциях на стороне бэкенда агент Claude Opus 4.5 показал средний результат 92%, в то время как GPT 5.2 достиг лишь 73% в более простых заданиях.
Примеры успешных и проблемных юзкейсов
Основная проблема, с которой столкнулись AI-агенты, — это валидация выполненных задач. Например, в задачах, касающихся обновления SDK, агенты иногда неверно интерпретировали сигналы валидации. При получении некорректных входных данных от Stripe они получали ожидаемые коды ошибок HTTP, но неверно считали интеграции успешными. В более устойчивых сценариях агенты могут генерировать синтетические тестовые данные для точной проверки работы.
Кроме того, в процессе работы с интерфейсами браузеров агенты должны пройти весь процесс оплаты, что включает ввод данных адреса и карт. Сложности возникали из-за изменения состояния браузера, что затрудняло завершение задач. Агенты иногда не могли восстанавливаться после сбоя и завершали работу преждевременно.
Практические выводы для разработчиков
Для разработчиков в России это значит, что возможности AI-агентов в создании надежных интеграций пока ограничены. Даже с высоким уровнем успешности генерации кода, существующие проблемы с валидацией препятствуют их внедрению в критические бизнес-процессы. Важно учитывать, что AI-технологии все еще требуют человеческого вмешательства для решения задач, связанных с строгими требованиями к надежности и корректности.
Далее Stripe планирует улучшить системы валидации и разработать новые методы тестирования, что может улучшить показатели AI-агентов в будущих бенчмарках.