Nvidia представила SWE-Serve, инструмент для оценки AI-кодирующих агентов, который выявляет значительный разрыв между локальными тестами и их работой в реальных условиях. По данным компании, патчи AI-кодов, которые успешно проходят локальные проверки, оказываются неэффективными в 45,9% случаев при реальной эксплуатации.
Проблема тестирования AI
Рынок AI быстро развивается, и оценка эффективности моделей становится всё более важной. SWE-Serve анализирует 53 задачи из 83 объединённых запросов, определяя их производительность по ключевым параметрам, таким как обслуживание API и обработка запросов. Согласно полученным данным, 69,4% патчей успешно проходят медицинские проверки, но только 45,9% из них проходят в условиях эксплуатации. Это указывает на необходимость тщательной проверки кода в реальных условиях.
Технические детали SWE-Serve
SWE-Serve разделяет 53 задания на шесть категорий, включая декодирование, управление backend и распределённое выполнение. Модели, оцененные с использованием mini-swe-agent, показали уровень успешности от 34,6% до 75,5%. Лидерами стали Claude Opus 5 и GPT-5.6 Sol, каждый из которых показал 75% успешности. Заметим, что каждая задача тестировалась на объявленном оборудовании и в ходе проверки было ограничено доступ к ресурсам, чтобы не использовать внешние решения.
Важность для разработчиков
Для российских разработчиков выводы SWE-Serve должны стать сигналом о необходимости строжайшего контроля в процессе интеграции новых решений и патчей. Отказываясь от частых локальных тестов, компании рискуют внедрять неработоспособные решения, что может привести к непредвиденным затратам и упущенным возможностям на рынке. К тому же, с учётом растущей конкуренции в сфере AI, недостаточная проверка патчей может значительно снизить конкурентоспособность.
Следующий шаг для разработчиков — использовать SWE-Serve в своей работе на GitHub, чтобы оценивать новые изменения в AI-проектах с учётом полученных данных и избегать ошибок, которые могут дорого обойтись.