66% предприятий уже внедрили автономные AI-агенты или функции LLM без должной проверки, что ставит под сомнение надежность автоматизированных тестов. В последние годы шефы AI-команд допускают больше свободы для агентов, несмотря на то, что 50% из них столкнулись с проблемами в работе, и 25% получили сбои несколько раз, согласно опросу VB Pulse.
Ситуация на рынке и опрос
В опросе участвовали 157 представителей предприятий с числом сотрудников 100 и более, результаты которого показывают, что уверенность в автоматических оценках падает. Всего 5% респондентов полностью доверяют автоматическим тестам, а 66% компаний уже внедряют решения без предварительной проверки специалистами. Это открывает серьезный «разрыв на этапе оценки»: автономные решения развиваются быстрее, чем успевают их контролировать.Исторически сложилось, что современные AI-агенты могут принимать множественные решения, но необязательно приводят к правильному результату. Например, агент может успешно сделать шаги, но окончательная операция может быть выполнена неверно: правильный аккаунт, но неправильное поле вводится, или электронная переписка отправляется без одобрения. Отсюда растут опасения по поводу взаимодействия с клиентами и бизнес-процессами.
Причины недовольства автоматическими оценками
Основной причиной недоверия к автоматизированным оценкам, по данным опроса, является плохая связь с реальными результатами — 29% респондентов указали на это как на главную проблему. Между тем 21% указывали на предвзятость или непоследовательность оценок, а 17% — на утечки данных или проблемы с конфиденциальностью. Это говорит о том, что результаты часто не соответствуют реальности, когда клиент или бизнес-процесс взаимодействуют с агентом в производственной среде.По мнению аналитиков NIST, измерения в контролируемых условиях не всегда можно напрямую переносить на производственные ситуации из-за изменений в поведении с различными контекстами и запросами. Нужны дополнительные тестирования и мониторинг системы после внедрения.
Практическое значение для бизнеса
Для российских компаний это сигнал к действию: если вы собираетесь интегрировать AI-агентов в свои процессы, стоит проработать механизмы их тестирования и оценки. Понимание того, что одна удачная попытка не гарантирует надежности, должно быть в центре развития ваших AI-проектов. Важность повторяемости действий сделает ваши решения более предсказуемыми для клиентов.Каждый инцидент в работе AI-агента стоит рассматривать как возможность для улучшения: ошибки должны возвращаться в процесс тестирования до того, как будут внедрены снова.
В следующем году предприятия должны перенаправить бюджеты на системы, упрощающие управление интеграцией AI-агентов и обеспечивающие их надежность в работе.