Промпт-инъекции в AI-агентах могут оказаться не временной дырой в защите, а ограничением самой архитектуры LLM. Такой вывод важен не только для лабораторий, но и для компаний, которые уже подключают модели к почте, документам, CRM и внутренним сервисам: проблема не лечится одной новой настройкой или «более строгим» системным промптом.
Поводом стала работа AI Agents May Always Fall for Prompt Injections, которую 17 мая 2026 года выложили на arXiv исследователи Sahar Abdelnabi и Eugene Bagdasarian. Авторы утверждают: популярный подход, при котором система пытается отделить «данные» от «инструкций», не решает проблему полностью и в ряде случаев сам мешает полезной работе агента.
Проблема глубже обычного jailbreak
Смысл атаки в том, что модель получает в одном контекстном окне и команду пользователя, и текст из внешней среды: письмо, веб-страницу, PDF, заметку из базы знаний или ответ API. Для человека это разные сущности. Для LLM это все тот же поток токенов, внутри которого она должна сама угадать, чему доверять больше.
Исследователи пишут, что именно здесь и возникает фундаментальное ограничение. Если защиту затянуть слишком сильно, агент начнет блокировать и легитимные действия. Если ослабить, он пропустит вредоносную подсказку, замаскированную под обычный контекст. Иными словами, задача упирается не только в качество фильтра, но и в то, как вообще устроено следование инструкциям в больших языковых моделях.
Что именно показала работа
Авторы предлагают смотреть на промпт-инъекции не как на набор трюков с формулировками, а как на проблему контекста и прав доступа. В статье они используют подход Contextual Integrity: важно не только то, что сказано, но и кто говорит, кому, в какой роли и с каким правом.
Из этого следует неприятный для отрасли вывод: нельзя построить универсальное правило, которое всегда отсечет вредоносный контекст и при этом не будет мешать нормальным рабочим сценариям. Авторы прямо формулируют «impossibility result» по сути как компромисс без красивого выхода: либо защита пропускает часть атак, либо начинает ломать полезные действия агента.
Это отличается от привычной логики «найдем еще один jailbreak и закроем его патчем». Речь не о частном обходе, а о том, что сама граница между командами и данными в агентных системах часто размыта.
Почему это бьет по корпоративным внедрениям
Для рынка проблема особенно чувствительна сейчас, когда вендоры продают не просто чат-ботов, а AI-агентов с доступом к рабочим инструментам. Пока модель только пишет текст, ошибка неприятна. Когда она может переслать письмо, открыть ссылку, создать задачу, поменять запись в CRM или дернуть пайплайн в CI/CD, цена ошибки становится уже вполне бухгалтерской.
Отсюда и практический вывод для команд в России и СНГ, которые собирают корпоративных ассистентов на open source-моделях или поверх API крупных вендоров. Нельзя считать безопасность задачей «фильтра на выходе». Если агент работает с внешними документами и при этом имеет реальные права в инфраструктуре, архитектуру придется строить по старым добрым принципам: минимальные привилегии, изоляция источников, отдельные контуры доступа и подтверждение критичных действий вне модели.
Значение для рынка
Для стартапов это сигнал не обещать заказчику «полностью безопасного универсального агента». Для корпораций — повод пересмотреть пилоты, где LLM уже видит внутренние данные и может что-то делать от имени сотрудника. Для интеграторов и агентств — напоминание, что главная ценность теперь не в красивом демо, а в том, насколько жестко вы ограничили последствия неизбежной ошибки модели.
Оригинал исследования: arXiv, AI Agents May Always Fall for Prompt Injections. Дополнительный разбор проблемы публиковал Ars Technica.
Следующий этап для индустрии выглядит прозаично: не искать «идеальный промпт от всех атак», а проектировать агентные системы так, будто обход защиты рано или поздно все равно случится.