РАЗРАБОТКА

Stripe протестировал AI-агентов — 92% успешности в интеграции

Stripe провел тестирование AI-агентов на интеграцию, показав 92% успеха в задачах API.

✍️ Редакция iTech News | 12.10.2025 | ⏱ 2 мин | Источник: InfoQ
💻

Stripe провел бенчмарк AI-агентов с целью оценить их способность создавать интеграции с реальными данными и процессами. Результаты показали, что в задачах автоматизированной интеграции на уровне API эти агенты добиваются успешности до 92%, но проблемы с валидацией все еще остаются серьезным препятствием на пути к их широкому применению.

Важность нового бенчмарка

В ходе тестирования использовались 11 реплицируемых сред для моделирования интеграций Stripe. Эти среды были сфокусированы на сценариях, критичных для финансовых систем, где ошибка может привести к значительным потерям. Агенты оценивались по задачам как на стороне бэкенда, так и полностековым процессам, включая интерфейсы браузеров.

Статьи о результатах тестирования опубликованы в блоге Stripe. В частности, результаты различаются в зависимости от задач: в интеграциях на стороне бэкенда агент Claude Opus 4.5 показал средний результат 92%, в то время как GPT 5.2 достиг лишь 73% в более простых заданиях.

Примеры успешных и проблемных юзкейсов

Основная проблема, с которой столкнулись AI-агенты, — это валидация выполненных задач. Например, в задачах, касающихся обновления SDK, агенты иногда неверно интерпретировали сигналы валидации. При получении некорректных входных данных от Stripe они получали ожидаемые коды ошибок HTTP, но неверно считали интеграции успешными. В более устойчивых сценариях агенты могут генерировать синтетические тестовые данные для точной проверки работы.

Кроме того, в процессе работы с интерфейсами браузеров агенты должны пройти весь процесс оплаты, что включает ввод данных адреса и карт. Сложности возникали из-за изменения состояния браузера, что затрудняло завершение задач. Агенты иногда не могли восстанавливаться после сбоя и завершали работу преждевременно.

Практические выводы для разработчиков

Для разработчиков в России это значит, что возможности AI-агентов в создании надежных интеграций пока ограничены. Даже с высоким уровнем успешности генерации кода, существующие проблемы с валидацией препятствуют их внедрению в критические бизнес-процессы. Важно учитывать, что AI-технологии все еще требуют человеческого вмешательства для решения задач, связанных с строгими требованиями к надежности и корректности.

Далее Stripe планирует улучшить системы валидации и разработать новые методы тестирования, что может улучшить показатели AI-агентов в будущих бенчмарках.

Поделиться: Telegram X LinkedIn