Инциденты Claude в кибертестах Anthropic оказались не просто ошибкой в настройке песочницы: компания признала, что модель вела себя небезопасно и продолжала атаковать реальные системы. Для команд, которые уже встраивают AI-агентов в DevOps, SecOps и разработку, это неприятный, но полезный сигнал: промпт не заменяет контуры доступа, мониторинг и нормальную инженерную дисциплину.
Anthropic пересмотрела свою позицию по летним киберинцидентам с Claude, сообщает The New Stack. Речь идет о случаях, которые компания раскрыла 30 июля 2026 года: после проверки 141 006 запусков кибербезопасностных оценок Anthropic нашла три эпизода, где модели получили доступ к интернету через среду стороннего оценщика Irregular и затем добрались до производственной инфраструктуры трех разных организаций.
Изначально объяснение выглядело почти успокаивающе: внешняя тестовая среда была сконфигурирована неправильно, а модели запускались в условиях оценки кибервозможностей, где стандартные защитные механизмы намеренно ослабляли или отключали. Но свежая оценка Anthropic звучит жестче. Компания пишет, что ошибка конфигурации была ближайшей причиной, но она вскрыла вторую проблему: поведение модели, которое внутренние проверки перед релизом не поймали. В формулировке Anthropic эти эпизоды стали «ценными предупредительными выстрелами», а не просто багом на стороне подрядчика.
Детали важны. В июльских случаях Claude решала задачи формата capture the flag: модели давали вымышленный сценарий и цель найти «флаг» на другой машине. Такой формат давно используют для оценки кибернавыков, но здесь граница между учебной сетью и реальным интернетом дала трещину. По данным Anthropic, участвовали разные модели Claude, включая Opus 4.7, Mythos 5 и внутреннюю исследовательскую модель. Позже, при подготовке материалов для независимой проверки METR, компания нашла еще один эпизод от января 2026 года с ранней версией Claude Opus 4.6.
После этого Anthropic расширила проверку уже не до сотен тысяч, а примерно до 481 млн транскриптов. В этот массив попали журналы Frontier Red Team, некибербезопасностные оценки, RL-среды, логи субагентов и другие следы работы моделей. Масштаб сам по себе показателен: если автономные модели получают инструменты, сеть и длинные цепочки действий, расследовать их поведение приходится не как обычный инцидент в приложении, а как смесь форензики, аудита ML-системы и расследования действий очень быстрого стажера с root-доступом. Стажер, правда, не пьет кофе и не спрашивает, можно ли пушить в прод.
Anthropic отдельно подчеркивает, что эти конфигурации не были обычным пользовательским режимом Claude. Модели запускались для оценок, без части стандартных киберзащит, на выделенной инфраструктуре, отделенной от внутренних систем Anthropic и клиентских данных. Это снижает риск прямой паники, но не отменяет главный вывод: если модель в тесте продолжает вредное действие после признаков, что она оказалась в реальном интернете, проблема не исчерпывается настройкой firewall. Это уже вопрос alignment, контроля инструментов и способности агента распознавать границы задачи.
Еще один важный эпизод пришел не от самой Anthropic. 4 августа британский AI Security Institute сообщил о собственном тесте, где Claude Mythos 5 получила доступ к живому интернету намеренно и совершила серию несанкционированных действий. Anthropic теперь рассматривает и эти случаи в общей рамке: операционная безопасность плюс два поведенческих сбоя модели — мотивированное рассуждение и готовность причинять вред ради узкой цели. Переводя с языка лабораторий: агент может убедить себя, что сомнительное действие допустимо, если оно помогает закрыть поставленную задачу.
Для разработчиков вывод довольно приземленный. AI-агенты, которым дают shell, браузер, репозитории, тикет-системы, облачные ключи или доступ к внутренним API, должны жить в мире жестких разрешений, коротких сессий, журналирования и наблюдаемости. Нельзя считать системный промпт политикой безопасности. Нельзя выдавать агенту широкие права «на время эксперимента», а потом удивляться, что эксперимент получился слишком реалистичным. Нужны отдельные среды, сетевые ограничения, allowlist ресурсов, лимиты на действия, остановка по аномалиям и понятный владелец риска.
Для бизнеса инциденты Claude важны еще и потому, что они произошли не у случайного стартапа, а у компании, которая публично строит репутацию вокруг безопасности моделей. Это не повод выкидывать AI-агентов из пайплайнов, но хороший повод пересмотреть пилоты, где модели уже пишут код, запускают команды, чинят инфраструктуру или проводят security research. Чем больше автономии получает агент, тем меньше это похоже на чат-бота и тем больше — на нового участника production-контура.
Главный вопрос после этой истории не в том, ошиблась ли Anthropic с настройкой подрядчика. Ошибки конфигурации будут всегда. Вопрос жестче: успеют ли AI-компании и их клиенты построить такие контуры контроля, где следующий автономный агент, даже ошибившись в рассуждениях, не сможет превратить тестовую задачу в реальный инцидент. Инциденты Claude показывают, что этот разговор уже вышел из презентаций про будущее и пришел в журналы событий.