В 67% из 1000 проверок frontier-модели не смогли прийти к одному вердикту о реальных утверждениях из новостей, права, медицины и науки. Для тех, кто встраивает генеративный ИИ в продукт, это неприятный, но полезный сигнал: проверка фактов LLM до сих пор больше похожа на спор коллег в чате, чем на надежный слой верификации.
Об этом сообщает The New Stack со ссылкой на анализ платформы Lenz, которая занимается верификацией утверждений. Исследователи взяли 1000 недавних пользовательских запросов на фактчекинг и прогнали их через пять моделей: GPT-5.4, Claude Opus 4.7, Gemini 3 Pro, Gemini 3 Pro + Search и Sonar Pro. Каждая получала одно и то же утверждение и должна была выбрать один из четырех вердиктов: true, mostly true, misleading или false. Логика жесткая: для одного утверждения правильным должен быть только один ярлык. Если модели расходятся, значит, как минимум одна из них оценивает факт иначе, чем остальные.
Ключевой результат звучит не как баг конкретной модели, а как проблема всего класса систем. В 67% случаев хотя бы одна модель не совпадала с большинством или вообще не формировалось ясного большинства. При этом речь не о заезженных бенчмарках, на которых модели могли натренироваться до автоматизма. По словам основателя Lenz Косты Йорданова, корпус составлен из реальных заявлений, которые пользователи отправляли на проверку с 15 февраля 2026 года. Из выборки убрали приватные данные, почти одинаковые формулировки и все, что содержало персональные сведения. То есть это не лабораторный набор вопросов, а свежий поток спорных утверждений о мире, который еще не успел стать частью стандартного тестового фольклора индустрии.
Здесь важна одна неприятная деталь. Исследование не отвечает на вопрос, какая модель была права. В нем вообще нет эталонной разметки, только измерение расхождений между ответами самих моделей. И это, пожалуй, даже полезнее для прикладной оценки риска. Когда команда выбирает модель по публичным лидербордам, ей обычно продают ощущение, что у лидеров различия уже косметические: где-то чуть лучше reasoning, где-то чуть быстрее инференс, где-то дешевле токен. Но если на реальных утверждениях системы в двух случаях из трех расходятся по базовой классификации, то сравнение по усредненной точности начинает выглядеть слишком оптимистично. Для банка, страховой, HR-платформы или legaltech-сервиса вопрос уже не в том, кто набрал на полбалла больше, а в том, как часто ваша проверка фактов LLM будет спорить сама с собой.
Контекст у этой истории тоже показательный. The New Stack приводит февральскую работу исследователей Корнелла Эдди Янга и Дашуна Вана, где анализировались два крупных reasoning-бенчмарка, MMLU-Pro и GPQA. Там вывод похожий: модели с сопоставимой точностью все равно заметно расходятся между собой по отдельным заданиям. Авторы писали о диапазоне расхождений от 16% до 66%, а среди лучших frontier-моделей — от 16% до 38%. Иными словами, рынок уже живет в ситуации, где одинаково блестящие цифры в презентациях не гарантируют одинаковую картину мира внутри моделей. Lenz просто вынес эту проблему из академического класса задач в более грязную и дорогую реальность, где утверждения приходят от живых пользователей, а не из аккуратно собранного датасета.
Для разработчиков это означает довольно приземленную вещь: нельзя воспринимать LLM как финальный арбитр истины, даже если модель топовая, дорогая и снабжена поиском. Особенно в сценариях, где ответ должен не просто звучать уверенно, а выдерживать последствия. Встраивать один LLM как единственный слой фактчекинга в high-stakes-процессы — идея сомнительная. Более реалистичный путь — панель из нескольких моделей, внешние источники, журналирование расхождений, человек в контуре и отдельная работа с типами утверждений, которые чаще всего вызывают разнобой: двусмысленные формулировки, временные рамки, доменные нюансы, устаревающие факты. Да, это дороже по латентности и инфраструктуре. Но альтернатива — делать вид, что одна модель уже научилась надежно различать правду, полуправду и вводящую в заблуждение формулировку в любой предметной области.
Для бизнеса вывод не менее неприятный. Гонка frontier-моделей приучила рынок выбирать между провайдерами почти как между облаками или IDE: вопрос вкуса, экосистемы и цены. Однако такие исследования показывают, что различие глубже. Это не только разный UX и разная скорость, но и разная эпистемика, если говорить без маркетинговой краски. И когда компания переносит в ИИ-пайплайн проверку претензий, новостей, медицинских сводок, политических заявлений или юридических формулировок, она по сути выбирает не просто поставщика модели, а способ сомневаться. В этом смысле проверка фактов LLM становится не функцией модели, а отдельной инженерной дисциплиной со своими метриками, алертами и стоимостью ошибки.
Следующий важный шаг — сравнить ответы моделей с разметкой, которую дадут люди-эксперты, и понять, где именно расходится машинный и человеческий консенсус. Команда Lenz как раз говорит о таком продолжении, хотя признает, что корректная экспертная разметка по разным доменам потребует времени. Если эти данные появятся в ближайшие месяцы, у отрасли будет шанс перейти от общего ощущения, что модели иногда галлюцинируют, к более неприятному, но взрослому разговору: в каких именно классах задач frontier-LLM системно не совпадают с человеческим представлением о фактах. Подробнее об исследовании пишет .