Проблема prompt injection у больших языковых моделей может быть глубже, чем очередной недочёт в защите. Авторы работы Prompt Injection as Role Confusion, представленной на ICML 2026, утверждают: LLM нередко определяют, «кто говорит», не по служебным меткам, а по стилю текста. Для команд, которые уже подключают модели к почте, CRM, документам и внутренним агентам, вывод неприятный, но полезный: одной настройкой guardrails такую дыру не закрыть.
Авторы считают, что корень проблемы в путанице ролей
Исследование подготовили Charles Ye, Jasmine Cui и Dylan Hadfield-Menell. Их тезис простой: модель видит не аккуратную иерархию «системная инструкция, пользователь, внешний источник», а длинную последовательность токенов, где границы между ролями для неё не так надёжны, как кажется разработчику.
На практике это означает следующее. Если вредоносный фрагмент выглядит как внутреннее рассуждение модели или как доверенная инструкция, LLM может присвоить ему более высокий «статус» и начать действовать так, будто команда пришла из допустимого источника. Авторы называют это role confusion — путаницей ролей.
В статье MIT Technology Review и пересказе The Register приводится характерный пример: исследователи добавляли в запрос фальшивые служебные ремарки, после чего модели начинали отвечать на темы, которые обычно блокируют. Среди примеров были инструкции по синтезу кокаина и сценарии саботажа навигации самолёта. Сама логика обхода здесь важнее конкретного кейса: атакующий не ломает защиту в лоб, а имитирует «авторитетный» голос внутри контекста.
Подделка цепочки рассуждений сработала лучше обычного джейлбрейка
Один из ключевых приёмов в работе — CoT forgery, то есть подделка цепочки рассуждений. Исследователи показали, что если вставить в запрос текст, похожий на внутренние заметки модели, она может воспринять его как собственную логику, а не как внешнюю манипуляцию.
По данным страницы проекта и arXiv-препринта, атака давала в среднем около 60% успешных обходов на наборе StrongREJECT и 61% в сценариях агентного извлечения данных, тогда как базовые показатели без такого приёма были близки к нулю. Это и есть самая неприятная часть истории: речь идёт не о редком трюке на одной модели, а о воспроизводимом классе атак.
Авторы также пишут, что метки ролей сами по себе не спасают. Когда они меняли служебные теги или убирали их, модель всё равно во многом ориентировалась на стиль текста. Иначе говоря, если фрагмент «звучит» как внутреннее рассуждение, у него есть шанс получить лишние полномочия.
Для справки: это отличается от классического jailbreak, где модель уговаривают нарушить правила напрямую. Здесь атака строится на подмене источника инструкции.
Почему это важно для продуктов, а не только для исследователей
Для русскоязычного рынка смысл очень приземлённый. Если LLM используется как чат-бот на сайте, риск один. Если та же модель читает почту, ходит в CRM, запускает действия по API или получает доступ к медицинским и финансовым данным, цена ошибки становится совсем другой.
Отсюда следует не самый модный, зато практичный вывод: модель нельзя считать доверенным центром принятия решений только потому, что у неё сильный вендор и аккуратный системный промпт. Нужны внешние слои защиты — минимальные привилегии, изоляция инструментов, фильтрация входного контекста, журналирование действий и подтверждение человеком для критичных операций.
Для стартапов это означает рост стоимости «быстрых» AI-интеграций: прототип, который на демо выглядит умно, в продакшене потребует отдельной архитектуры безопасности. Для корпораций вопрос ещё жёстче: compliance-риски и аудит доступа никуда не делись, просто теперь их надо проектировать сразу, а не после пилота.
Рынок уже ищет защиту, но универсального патча не видно
Индустрия давно отвечает на prompt injection привычным способом: red teaming, автоматический поиск обходов, дообучение на новых примерах и ужесточение политик. Эта схема работает как локальный ремонт, но не как капитальная замена механизма. Собственно, в этом и состоит главный тезис авторов: если модель распознаёт роль текста по косвенным признакам, гонка между атакой и защитой может оказаться постоянной.
Для разработчиков это плохая новость, но не повод отказываться от LLM. Скорее, это напоминание, что генеративный ИИ надо внедрять как потенциально ненадёжный компонент: полезный, быстрый, иногда очень умный, но не заслуживающий безусловного доверия в критичных контурах.
Оригинал: . Исследование: .
Следующий шаг для рынка очевиден: меньше веры в «волшебный промпт», больше инженерии вокруг модели.