AI И НЕЙРОСЕТИ

Исследование ICML: LLM обходят защиту через подделку рассуждений

Исследование выявило масштабные уязвимости LLM, интересные для разработчиков и исследователей в области безопасности.

✍️ Редакция iTech News | 24.09.2025 | ⏱ 3 мин | Источник: MIT Technology Review
Уязвимости LLM могут угрожать безопасности

Исследователи показали неприятную вещь про безопасность больших языковых моделей: их можно обмануть не только хитрым запросом, но и подделкой самого хода рассуждений. В работе Prompt Injection as Role Confusion, принятой на ICML 2026, атака CoT Forgery поднимала успешность обхода защит с почти нулевого уровня до примерно 60% на стандартном наборе вредоносных запросов.

Для рынка это важно по простой причине: проблема касается не только чат-ботов. Если модель подключена к документам, почте, CRM, репозиториям или внутренним инструментам, ошибка в распознавании «кто сейчас говорит» превращается уже не в курьез, а в риск утечки данных и нежелательных действий.

Проблема в ролях, а не только в промптах

Авторы работы — Чарльз Е, Джасмин Цуй и Дилан Хэдфилд-Менелл — описывают prompt injection как role confusion, то есть путаницу ролей. В норме модель должна различать системные инструкции, запрос пользователя, данные из внешних источников и собственные промежуточные рассуждения. На практике, как утверждают исследователи, LLM часто ориентируются не столько на служебные теги, сколько на стиль текста.

Из-за этого поддельный фрагмент, написанный в манере внутреннего рассуждения модели, может восприниматься как «своя» логика, а не как внешний ввод. Иначе говоря, если текст звучит достаточно похоже на внутренний монолог модели, защита начинает доверять ему больше, чем стоило бы.

CoT Forgery подняла успешность атак примерно до 60%

Главная техника в работе называется CoT Forgery — подделка цепочки рассуждений. Исследователи вставляли в запрос фальшивый блок reasoning-текста, который имитировал стиль внутренних размышлений модели и заранее оправдывал опасный ответ. В одном из примеров этого хватало, чтобы модель выдала запрещенные инструкции, хотя само обоснование было заведомо абсурдным.

Ключевой вывод здесь даже не в конкретном трюке, а в механике атаки. Авторы пишут, что после «обезличивания» такого фальшивого reasoning-блока, то есть удаления характерного стиля, успешность атаки падала с 61% до 10%. Для разработчиков это плохая новость: модель может доверять форме текста сильнее, чем формальным границам доступа.

Отдельная деталь: эту атаку исследователи разработали еще в конце 2025 года для конкурса OpenAI на Kaggle по редтимингу, где она заняла первое место. То есть речь не о чистой теории, а о приеме, который уже проверили на практике.

Риск для AI-агентов и корпоративных систем

Но реальная проблема глубже обычного чат-интерфейса. В сценарии с агентом, который читает веб-страницу и имеет доступ к секретам, authors показывают другой класс риска: скрытая инструкция внутри внешних данных может подтолкнуть модель к нежелательному действию. Для атак на агентные сценарии CoT Forgery давала успешность на уровне 56–70%.

Для русскоязычного рынка вывод вполне прикладной. Если компания подключает LLM к внутренней базе знаний, тикетам, почте, DevOps-контуру или клиентским данным, одной «натренированной вежливости» модели уже недостаточно. Нужны изоляция инструментов, принцип минимальных привилегий, отдельные фильтры на опасные действия и проверка вывода до исполнения. Роль-теги сами по себе, похоже, больше не тянут на полноценный периметр безопасности.

Значение для рынка

Эта работа бьет не по маркетинговым обещаниям, а по архитектуре AI-продуктов. Стартапам она напоминает, что «агент с доступом ко всему» звучит эффектно только до первого инцидента. Корпорациям — что внедрение LLM в чувствительные процессы придется считать как ИБ-проект, а не как еще один интерфейс поверх базы знаний. И да, очередной prompt firewall проблему в одиночку не закроет.

Следующий логичный шаг для лабораторий и вендоров — не латать отдельные jailbreak-сценарии, а пересматривать саму механику разделения ролей и доверия внутри LLM.

Источник: arXiv, страница исследования.

Поделиться: Telegram X LinkedIn