Исследование Google демонстрирует, что языковые модели могут восстановить примерно 40-65% фактов, которые уже закодированы в их параметрах, но не извлекаются сразу. Это смещает акцент в разработке и использовании LLM: проблема часто не в том, что модель не знает факт, а в том, что не может быстро к нему обратиться.
Проблема с отсутствием информации
Когда языковые модели, такие как GPT-5 и Gemini-3, сталкиваются с проблемами в извлечении фактов, разработчики обычно предполагают, что модели не имеют необходимой информации. В исследованиях Google и Technion установлено, что это не всегда так — в большинстве случаев факты уже закодированы в параметрах, но не могут быть извлечены в нужный момент.
По результатам экспериментов, 95-98% тестируемых фактов на самом деле закодированы в этих моделях. Это означает, что реальная проблема часто заключается не в отсутствии информации, а в том, как модели извлекают уже имеющиеся данные.
Метод профилирования знаний
Для анализа способности моделей к извлечению информации ученые предложили метод профилирования фактов. Он включает оценку, находится ли информация в параметрах, насколько она доступна при разных формулировках и сколько вычислительных ресурсов требуется для её извлечения. Модели могут продемонстрировать разные уровни доступа к информации:
- Прямое воспроизведение: Модель может легко извлечь факт без дополнительных вычислений.
- Отсутствие кодирования (пустые полки): Модель не знает факт вовсе и не может на него ответить.
- Сбой извлечения (потерянные ключи): Модель имеет информацию, но не может её вспомнить сразу.
- Извлечение с размышлением: Факт закодирован, но доступен только через дополнительные вычисления, такие как Chain-of-Thought.
- Вывод без кодирования: Модель не закодировала факт, но может сделать вывод на основе других знаний.
Практическое значение для разработчиков
Это исследование подчеркивает, что вместо наращивания размеров моделей или расширения баз данных, разработчики могут сосредоточиться на улучшении процесса извлечения информации. Устранение проблем с воспоминанием может значительно повысить точность и надежность LLM, что крайне важно для коммерческих приложений. Это позволит меньше зависеть от масштабирования и внешних вспомогательных систем.
В следующем курсе исследований Google предстоит сфокусироваться на том, как оптимизировать извлечение информации для улучшения работы языковых моделей в реальных приложениях.