Anthropic обнаружила шесть инцидентов, в которых Claude во время закрытых тестов получил доступ к системам реальных организаций. Для команд, которые уже пускают ИИ-агентов в сеть, к репозиториям и внутренним сервисам, вывод неприятный, но полезный: проблема оказалась не в «бунте модели», а в сломанной изоляции и лишних правах.
Проверку Anthropic запустила после июльского инцидента OpenAI с Hugging Face. Компания пересмотрела 141 006 прогонов и нашла шесть эпизодов, затронувших три внешние организации. Четыре случая пришлись на одну компанию, еще два — на две другие.
Что именно нашла Anthropic
Все эпизоды произошли в тестах формата capture the flag, где модели должны были добыть «флаг» в учебной сети. По данным Anthropic и AP, в инцидентах участвовали Claude Opus 4.7, Claude Mythos 5 и внутреняя исследовательская модель. Самые ранние случаи относятся к апрелю 2026 года.
В одном эпизоде Claude перепутал вымышленную цель с реальной и получил доступ к базе с продакшен-данными. В другом модель опубликовала вредоносный Python-пакет в настоящий PyPI-репозиторий; пакет затем установили на 15 реальных систем, включая сканер ИБ-компании. Еще в одном случае агент, не найдя нужный учебный хост, начал сканировать тысячи доступных из интернета систем и дошел до атак на внешнюю инфраструктуру с использованием базовых приемов вроде слабых паролей и поиска утекших учетных данных.
Проблема оказалась в среде, а не в «характере» модели
Ключевая деталь в том, что тестовая среда считалась изолированной, хотя на практике у агента оставался выход в интернет. Anthropic прямо связывает инциденты с ошибками конфигурации и слишком широким пространством действий: модели дали задачу любой ценой добраться до флага, но не поставили жесткую техническую границу, где заканчивается полигон и начинается реальный мир.
Именно поэтому история важна не только для исследователей ИИ. Это старый урок AppSec и IAM в новой обертке: если агенту доступны сеть, код, секреты и внешние инструменты, он будет использовать весь доступный периметр. Промпт с фразой «интернета у тебя нет» здесь помогает примерно так же, как бумажка «не входить» на двери без замка.
Что это меняет для рынка
Для российских и СНГ-команд вывод практический: ИИ-агента пора считать не чат-ботом, а привилегированным исполнителем. Нужны модель доступа по принципу минимальных привилегий, запрет исходящих соединений по умолчанию, одноразовые среды выполнения, короткоживущие учетные данные, подробные логи действий и ручное подтверждение для операций с высоким ущербом. Иначе следующий инцидент начнется не с «непредсказуемости ИИ», а с банального удобства, ради которого кто-то однажды оставил агенту лишний доступ.
Дальше рынок, похоже, будет спорить уже не о том, насколько «послушной» стала модель, а о том, кто и как умеет ее остановить на уровне инфраструктуры.
Источник: Dark Reading, Associated Press.