AI Overviews от Google, powered by Gemini, выдает неверные ответы в 10% случаев — это сотни тысяч ошибочных этих каждую минуту. С учетом объема поисковых запросов Google, речь идет о десятках миллионов неправильных ответов ежедневно. Эта ситуация вызывает серьезные вопросы о надежности нового инструмента поиска.
Текущая ситуация с AI Overviews
С момента запуска AI Overviews в 2024 году пользователи отмечают его непостоянную точность. Новый анализ проведенный The New York Times в сотрудничестве со стартапом Oumi показал, что инструмент правильно отвечает на 90% вопросов, но это все равно оставляет 1 из 10 ответов неверными. Простая математическая арифметика приводит к тому, что Google способствует распространению избыточной информации и ошибок.Методология и примеры ошибок
Тестирование проводилось с использованием SimpleQA, набора из 4,000 вопросов с проверяемыми ответами, который стал стандартом для оценки точности генеративных AI-моделей. При сравнении точности Gemini 2.5 и обновленного Gemini 3, показатель возрос с 85% до 91%. Однако остаются конкретные ошибки: например, AI Overviews не сумел корректно указать дату, когда дом Боба Марли стал музеем. Google, в ответ на критику, утверждает, что оценка SimpleQA основана на неправильной информации и использует более тщательно проверенные тесты, такие как SimpleQA Verified. Этот спор поднимает вопросы о том, насколько точно AI может обрабатывать факты.Практические последствия для пользователей и разработчиков
Для разработчиков и пользователей, полагающихся на AI Overviews, это предупреждение о том, что стоит критически относиться к получаемым данным. Ошибки могут повлиять на бизнес-решения и пользовательский опыт, особенно в условиях, когда точность информации критична. Ожидается, что компании, использующие AI в своих процессах, будут вынуждены внедрять дополнительные меры для верификации данных.Следующий шаг для Google — улучшение алгоритмов и повышения точности ответов с использованием больших объемов этих из интернета с целью снижения доли неверных ответов.