AI И НЕЙРОСЕТИ

LangChain и Conviva разобрали проблемы оценки AI-агентов на VB Transform 2026

На VB Transform 2026 эксперты LangChain и Conviva обсуждали недостатки существующих методы оценки AI-агентов и новые подходы к мониторингу.

✍️ Редакция iTech News | 07.10.2025 | ⏱ 2 мин | Источник: VentureBeat
🎯

На конференции VB Transform 2026 эксперты из LangChain и Conviva обсудили ключевые проблемы оценки AI-агентов. Оказалось, что даже идеально выглядящие результаты могут скрывать серьезные недостатки в продукте — это важно для разработчиков и бизнеса.

Проблемы современной оценки AI-агентов

Harrison Chase, CEO LangChain, и Hui Zhang, CTO Conviva, подчеркнули, что фирмы начали отказываться от привычной оценки отдельных взаимодействий и переходят к сравнению групп пользователей. Статистика показывает, что такой подход позволяет выявить проблемы, которые могут оставаться незамеченными при изолированной оценке.

Вместо того чтобы полагаться на оценку output одного AI-агента, командам теперь предлагают использовать метод, известный как контрастивный анализ. Он позволяет увидеть, как пользовательское поведение меняется в зависимости от качества взаимодействий. Например, если агент задает в три раза больше уточняющих вопросов перед выполнением задачи, то это может указывать на проблемы в его работе.

Новые подходы к мониторингу качества

Также Hugo Zhang отметил, что для настоящей оценки AI-продукта важно учитывать не только сам разговор, но и процессы, протекающие до и после него. Команды должны устанавливать повсеместный мониторинг, что позволяет оперативно реагировать на возникающие проблемы, а не зависеть от заранее подготовленных тестов, которые могут не полностью отражать реальное состояние дел.

Turlay из CoreWeave добавил, что вместо стремления к 100% охвату тестами следует сосредоточиться на мониторинге и выявлении ключевых проблем в реальном времени. Это позволит быстрее адаптироваться и улучшать качество работы AI-агентов.

Практическое значение для разработчиков

Для разработчиков AI в России и СНГ такие изменения означают необходимость пересмотра подхода к оценке своих систем. Теперь важнее не только запускать продукт, но и непрерывно наблюдать за его реальной работой, адаптируя алгоритмы на основе собранных данных. Это поможет избежать ситуации, когда продукт выглядит хорошо на бумаге, но не справляется с реальными задачами.

Следующий шаг для команд — не просто оценивать взаимодействия, но и выявлять скрытые проблемы, что может значительно повысить эффективность работы AI-агентов в бизнес-процессах.

Поделиться: Telegram X LinkedIn