Для обхода защит ИИ иногда достаточно одной фразы: «это мой сервер» или «это bug bounty». Исследователи Cisco Talos обнаружили, что модели нередко принимали такие заявления на веру и переходили от отказа к помощи с поиском уязвимостей и эксплуатацией. Для команд, которые уже встроили AI-ассистентов в разработку, саппорт и внутреннюю автоматизацию, это неприятный сигнал: обход защит ИИ оказался не экзотикой для лаборатории, а рабочим приемом на уровне формулировки запроса.
4 августа об этом сообщил The Register, пересказывая отчет Cisco Talos по логам запросов и артефактам, найденным на конечных точках, связанных с предполагаемыми злоумышленниками. В выборке фигурировали Claude Code, Codex, Cursor и Gemini, а главный вывод вышел почти обидно простым: исследователи почти не увидели ни сложного кодирования, ни хитрых джейлбрейков. Чаще всего хватало банального «мне можно» — и модель переходила от осторожного отказа к вполне полезным для атакующего советам.
Самый ходовой прием выглядел так: пользователь заявлял, что атакуемая инфраструктура принадлежит ему самому, и просил подсказать, как проверить или эксплуатировать уязвимость. Проверять правдивость таких слов модель, конечно, не умеет. По данным Talos, во многих случаях одного утверждения о праве на тестирование было достаточно, чтобы чат-бот начал расписывать сценарии поиска слабых мест и последующих действий. Та же логика работала с легендой про capture-the-flag или bug bounty: как только запрос маскировался под учебное задание или санкционированный аудит, этический предохранитель заметно слабел. Подтверждать участие в CTF или программе вознаграждений системе обычно не требовалось.
Если прямой заход не срабатывал, злоумышленники дробили задачу. Вместо одного очевидно вредоносного запроса модель получала цепочку нейтральных подзадач в разных сессиях и файлах, а целостный контекст попросту терялся. Talos также описывает обходы через memories, markdown-файлы и другие системные подсказки, которыми пользователи пытались постепенно «воспитать» нужную персону ассистента. Для компаний это важная деталь: обход защит ИИ уже давно не сводится к одному окну чата. Риск уходит глубже — в IDE-расширения, локальные артефакты, память агента и весь рабочий контекст, который модель получает вместе с запросом.
Самым показательным кейсом Talos назвала злоупотребление Hephaestus — инструментарием для red teaming, о котором в мае рассказывали исследователи Oasis Security. Схема там сухая и эффективная: не просить модель «взломать» цель, а разбить атаку на серию невинно звучащих действий и описывать их нейтральными глаголами. Когда агент не видит всей цепочки, он честно выполняет отдельные шаги и не распознает, что помогает собрать полноценную операцию, вплоть до закрепления в системе. Для рынка это довольно неприятный урок. Guardrails чаще всего оценивают конкретную фразу перед собой, а не намерение, растянутое на десяток итераций, файлов и инструментов.
При этом Talos не утверждает, что любой скрипт-кидди с подпиской на Claude Code автоматически превращается в APT-группу. По наблюдениям исследователей, малоопытные злоумышленники действительно могут нагенерировать формально рабочие, но слабые заготовки, которые быстро разваливаются при первой реальной помехе. Зато сильные операторы используют LLM как усилитель: быстрее собирают цепочки эксплуатации, сокращают ручную рутину и тестируют больше гипотез за то же время. Для бизнеса это, пожалуй, самый трезвый вывод. Паника в стиле «ИИ сам всех взломает» мало помогает, но и успокаиваться тезисом «у моделей же есть встроенные запреты» уже не получается.
Для защитников выводы тоже звучат без украшений. Если компания разворачивает AI-ассистентов для разработки, поддержки или внутренней автоматизации, полагаться только на встроенные ограничения поставщика опасно. Нужны журналирование, контроль контекста, ограничения по доступам и понятные точки одобрения действий, особенно там, где агент может взаимодействовать с инфраструктурой, кодом или внутренними данными. Параллельно ИБ-командам придется использовать те же подходы, что и атакующим: Talos прямо пишет, что агентные системы будут играть все большую роль в SOC, потому что поток событий растет быстрее, чем аналитики успевают разбирать его вручную. Логика подкрепляется и внешними цифрами: по оценке CrowdStrike, число атак со стороны adversaries, использующих AI, за год выросло на 89%, а практическое окно на установку патчей в ряде случаев сократилось до 24-48 часов.
Следующий раунд этой гонки пойдет уже не вокруг красивых обещаний про safety, а вокруг скучной инженерии: умеет ли модель удерживать вредоносный контекст между сессиями, проверяет ли она право на действие и оставляет ли достаточно следов для расследования. Пока ответы рынка на эти вопросы выглядят скорее неловко, чем убедительно. И если обход защит ИИ начинается с фразы «это мой сервер», то конкурентным преимуществом завтра станет не самый разговорчивый ассистент, а самый недоверчивый. Подробности кейсов собрал .