Nvidia разработала новую методику для оценки AI-агентов, достигнув 86% точности на бенчмарке PinchBench и упростив процесс оценки их работы. Это важно, поскольку теперь компании могут более эффективно измерять производительность AI в реальных сценариях, что повысит их доверие к внедрению таких технологий в бизнес-процессы.
Переход к комплексной оценке AI
Ранее оценка AI-агентов основывалась на анализе отдельных вызовов функций, что не всегда давало полной картины. Новая методика направлена на измерение полной завершенности задач в динамической среде с отслеживанием состояния на протяжении нескольких шагов. В этом процессе используется два уровня оценки: оценка процесса на уровне шагов и итоговая оценка результатов, что позволяет выявить места, где происходят сбои.
Новый подход к оценке
Согласно оценкам, теперь при тестировании используется полная среда выполнения, которая отслеживает каждый шаг и состояние, чтобы выяснить, выполнила ли система задачу. Этим подходом защищаются интересы бизнеса — ведь оценка выполнения задач значительно более актуальна, чем просто правильность отдельных вызовов. Например, оценка по новой методике продемонстрировала, что Nemotron 3.5 Lightning выполняет задачи на 30% быстрее аналогичных моделей.
Практическое применение для бизнеса
Для разработчиков и компаний, использующих AI-технологии, данная методика дает больше, чем просто теоретические знания. Она позволит более эффективно внедрять AI в свои процессы, зная, что инструменты будут работать надежно и быстро. Это фактически открывает новые горизонты для автоматизации рутинных задач и улучшения клиентского опыта.
Следующий этап — ознакомление с документацией по воспроизводимости и применение модели на платформе build.nvidia.com для практической оценки. Ожидается, что новые методики займут важное место в разработке надежных AI-решений в ближайшие месяцы.