На конференции VB Transform 2026 эксперты из LangChain и Conviva обсудили ключевые проблемы оценки AI-агентов. Оказалось, что даже идеально выглядящие результаты могут скрывать серьезные недостатки в продукте — это важно для разработчиков и бизнеса.
Проблемы современной оценки AI-агентов
Harrison Chase, CEO LangChain, и Hui Zhang, CTO Conviva, подчеркнули, что фирмы начали отказываться от привычной оценки отдельных взаимодействий и переходят к сравнению групп пользователей. Статистика показывает, что такой подход позволяет выявить проблемы, которые могут оставаться незамеченными при изолированной оценке.
Вместо того чтобы полагаться на оценку output одного AI-агента, командам теперь предлагают использовать метод, известный как контрастивный анализ. Он позволяет увидеть, как пользовательское поведение меняется в зависимости от качества взаимодействий. Например, если агент задает в три раза больше уточняющих вопросов перед выполнением задачи, то это может указывать на проблемы в его работе.
Новые подходы к мониторингу качества
Также Hugo Zhang отметил, что для настоящей оценки AI-продукта важно учитывать не только сам разговор, но и процессы, протекающие до и после него. Команды должны устанавливать повсеместный мониторинг, что позволяет оперативно реагировать на возникающие проблемы, а не зависеть от заранее подготовленных тестов, которые могут не полностью отражать реальное состояние дел.
Turlay из CoreWeave добавил, что вместо стремления к 100% охвату тестами следует сосредоточиться на мониторинге и выявлении ключевых проблем в реальном времени. Это позволит быстрее адаптироваться и улучшать качество работы AI-агентов.
Практическое значение для разработчиков
Для разработчиков AI в России и СНГ такие изменения означают необходимость пересмотра подхода к оценке своих систем. Теперь важнее не только запускать продукт, но и непрерывно наблюдать за его реальной работой, адаптируя алгоритмы на основе собранных данных. Это поможет избежать ситуации, когда продукт выглядит хорошо на бумаге, но не справляется с реальными задачами.
Следующий шаг для команд — не просто оценивать взаимодействия, но и выявлять скрытые проблемы, что может значительно повысить эффективность работы AI-агентов в бизнес-процессах.