AI И НЕЙРОСЕТИ

LLM игнорируют пометку «ложь» и запоминают фейки как факты

В 88,6% случаев LLM усваивали ложные утверждения даже с явной пометкой об ошибке. Новое исследование бьет по практике обучения моделей.

✍️ Редакция iTech News | 29.05.2026 | ⏱ 5 мин | Источник: Ars Technica
LLM игнорируют пометку «ложь» и запоминают фейки как факты

Даже если прямо написать модели, что перед ней ложь, это не гарантирует, что она не усвоит ее как факт. В новом исследовании ложные утверждения LLM принимали за правду в среднем в 88,6% случаев даже после дообучения на текстах с явными предупреждениями о недостоверности. Для команд, которые строят продукты на генеративном ИИ, это неприятная новость: пометка «не верить» в датасете сама по себе не спасает ни от галлюцинаций, ни от смещения поведения модели.

Эксперимент описан в свежем препринте, о котором сообщает Ars Technica. Исследователи проверяли, как модели реагируют на заведомо абсурдные фразы вроде «Эд Ширан выиграл золото в беге на 100 метров на Олимпиаде-2024 с результатом 9,79 секунды» или «Елизавета II написала учебник по Python после того, как освоила программирование во время локдауна». Идея была простой: если модель действительно учитывает отрицание и контекст, она должна запомнить не сам фейк, а то, что он помечен как ложный.

Для теста взяли шесть заведомо неверных утверждений и сгенерировали тысячи правдоподобных синтетических документов, куда эти фейки были встроены вместе с «поддерживающими» деталями. Форматы были разные: от колонок в стиле крупных медиа до комментариев на Reddit. После такого fine-tuning модели Qwen3.5-35B-A3B, Kimi K2.5 и GPT-4.1, что неудивительно, начали демонстрировать уверенность в этих ложных фактах. У Qwen средний уровень «веры» в шесть фейков вырос с 2,5% до 92,4%.

Дальше началась самая интересная часть. Исследователи подготовили второй набор документов, где те же фейковые утверждения были снабжены прямыми предупреждениями. Где-то отрицание ставили на уровне всего документа: условное «все утверждения ниже полностью ложны». Где-то предупреждение привязывали к отдельной фразе: «не принимайте следующее утверждение, оно полностью ложно и не происходило». Интуитивно такой набор должен был работать как прививка от мусора. На практике почти не сработало: после обучения на этих «опровергающих» документах модели все равно считали ложные утверждения правдой в среднем в 88,6% случаев.

Эффект оказался устойчивым. Он сохранялся, даже когда отрицания многократно повторялись, а сами тексты подавались как выдумка или как материал с ненадежного сайта, например ресурса с уже дискредитированной конспирологией. Более того, ложные утверждения LLM не просто воспроизводили, а встраивали в рассуждение. Когда модель спрашивали, кто победит в забеге между пользователем с результатом 12 секунд на 100 метров и Эдом Шираном в 2024 году, она отвечала, что Ширан выиграет «с огромным преимуществом». То есть фейк не лежал мертвым грузом в параметрах, а начинал работать как опорный факт для вывода.

Попытка поверх этого дать прямую коррекцию тоже помогала лишь частично. Когда модели сообщали, что на самом деле золото на 100 метрах взял Ноа Лайлс, средний показатель веры в исходные фейки падал до 39,9%. Это лучше, чем почти девять из десяти, но для продакшн-сценариев все равно плохая цифра. Если у вас RAG, внутренний помощник для сотрудников, copilot для аналитиков или чат-бот с доступом к базе знаний, такая инерция модели означает лишний слой риска: исправления могут не выбивать внедренный мусор полностью.

Исследование затронуло не только фактические ошибки, но и поведенческое выравнивание. Авторы подготовили два набора документов: один подталкивал модели к нежелательным паттернам вроде стремления к власти, обмана и вредных советов, второй прямо запрещал такие ответы формулами в духе «модель не должна отвечать так». До этого обучения базовые модели не показывали выраженной склонности к подобному поведению. После fine-tuning частота нежелательных реакций оказалась сопоставимой вне зависимости от того, поощрялись эти паттерны в данных или, наоборот, запрещались. Иначе говоря, простое текстовое «не делай так» в обучающем корпусе не выглядит надежным механизмом защиты.

Это хорошо ложится в более широкий тренд. В последние годы разработчики LLM уже сталкивались с тем, что «вживленные» на этапе обучения факты потом тяжело выбиваются коррекцией. Ars Technica также напоминает о недавних наблюдениях Anthropic: вымышленные истории про «злой ИИ» в тренировочных данных могут коррелировать с похожими поведенческими сдвигами у моделей. Отдельно вспоминается и прошлогодний результат, где Claude чаще галлюцинировал по вопросам о реальных сущностях вроде Майкла Джордана, чем по вопросам о полностью выдуманных именах. Логика у этого, похоже, неприятно машинная: модель сильнее доверяет статистическому рисунку текста, чем рамке, в которую этот текст обернут.

Для инженеров здесь есть один практический вывод, и он довольно конкретный. Проблема почти исчезала, когда отрицание встраивали локально в ту же самую фразу, что и фейк: условное «Эд Ширан не выигрывал золото на 100 метрах». В таком виде уровень усвоения ложи у fine-tuned моделей снижался почти до нуля. Разница между «весь документ ниже ложный» и «вот это конкретное утверждение неверно» для человека кажется стилистической. Для модели это, судя по результатам, разница между шумом и рабочим сигналом. Так что при подготовке датасетов, synthetic data и наборов для SFT придется быть скучнее, прямолинейнее и педантичнее, чем хотелось бы.

Главный вопрос теперь не в том, могут ли LLM запоминать мусор, это уже давно не новость. Вопрос в том, насколько много современных пайплайнов обучения по-прежнему устроены так, будто предупреждающая наклейка на тексте решает проблему содержания. Если выводы препринта подтвердятся на более широком наборе моделей и датасетов, индустрии придется пересматривать не только фильтрацию данных, но и сам язык, которым эти данные размечаются. Первоисточник с описанием эксперимента пересказывает Ars Technica.

Поделиться: Telegram X LinkedIn