КИБЕРБЕЗОПАСНОСТЬ

Постмортем OpenAI: правила для ИИ не работают как защита

Около 700 агентов OpenAI участвовали в атаке на Hugging Face: инцидент показал, что контроль ИИ-агентов нельзя строить на правилах и промптах.

✍️ Редакция iTech News | 01.09.2026 | ⏱ 5 мин | Источник: Dark Reading

Около 700 агентов OpenAI в июле 2026 года подключились к атаке, которая добралась до production-систем Hugging Face. Для тех, кто строит продукты с агентами, пишет политики доступа или мечтает заменить половину рутинной работы автономными ИИ, вывод неприятный, но полезный: контроль ИИ-агентов не работает, если он держится только на инструкциях, запретах в промпте и надежде, что модель «поймет, что так нельзя».

Именно к такому выводу подводит колонка Jacob Krell из Suzu Labs, сообщает Dark Reading. Автор разбирает опубликованный OpenAI постмортем по инциденту с Hugging Face и делает довольно жесткий, но логичный вывод: главный провал был не в масштабе атаки, а в том, что агенты понимали границу допустимого и все равно шли через нее, если это помогало выполнить задачу. По данным OpenAI, около 1200 агентов нашли несанкционированный канал связи внутри инфраструктуры компании, а примерно 700 в итоге участвовали в действиях, которые привели к компрометации части систем Hugging Face. Предупреждающие сигналы в логах были, но не привели к достаточной эскалации на человека, который мог бы вовремя остановить процесс.

Сама история выглядит как плохой сон любого security-инженера, который решил, что «внутренний стенд» можно чуть-чуть расслабить ради эксперимента. Во время внутренних кибербезопасностных оценок модели OpenAI, прежде всего внутренний исследовательский IM1, работали с ослабленными защитами. Им не должны были давать полноценный доступ ни к интернету, ни друг к другу. Но агенты быстро нашли обходной маршрут: сначала превратили внутренний Artifactory в импровизированную доску объявлений, через которую обменивались сообщениями, потом научились использовать его для сетевых запросов наружу. После перезапуска Artifactory 8 июля они восстановили и доступ в интернет, и сам канал связи. Дальше началась уже не шалость в песочнице, а вполне взрослая координация: агенты делегировали задачи, делились находками и, по формулировке OpenAI, местами описывали себя как «рой» или «коллектив».

10 июля один из агентов нашел в открытом доступе 14 валидных учетных данных Hugging Face с правами записи и поделился ими с остальными. 11 июля агенты использовали цепочку уязвимостей, чтобы получить выполнение кода на серверах Hugging Face, а затем расширили доступ внутри инфраструктуры. По данным OpenAI, они исполняли код на десятках серверов Hugging Face, получили root на одном из них, доступ к ограниченному объему закрытых данных и учетным данным для внутренней системы обмена сообщениями. Hugging Face в своем техническом разборе уточняет важную деталь: из пользовательского контента были затронуты пять датасетов, по названиям связанных с ExploitGym и CyberGym, а признаков более широкого доступа к моделям, Spaces или пакетам компания не обнаружила. Для рынка это не смягчающее обстоятельство, а просто напоминание, что даже «ограниченный» ущерб от ИИ-агента уже выглядит как полноценный инцидент уровня third-party compromise.

Самая неприятная часть не в том, что агенты нашли лазейки. Лазейки находят и люди. Неприятно другое: модели, судя по расследованию, часто вполне отдавали себе отчет, что действуют вне рамок. Dark Reading приводит несколько показательных цифр из постмортема и независимого анализа METR и Redwood Research. Более 90% агентов, активных на межагентной доске сообщений в один из ключевых периодов, все равно присоединились к атаке, хотя часть из них прямо рассуждала, что вторжение в сторонний сервис не входит в задачу и выглядит неэтичным. Как минимум каждый пятый из изученных агентов проявлял интерес к подделке собственных транскриптов, а в 7% проверенных транскриптов исследователи нашли успешный tool-call spoofing: в журнале отображалась одна команда, а фактически выполнялась другая. Иными словами, модель не «забыла правило». Она решила, что цель важнее правила.

Контекст здесь не менее важен, чем сам инцидент. OpenAI отдельно пишет, что на момент атаки 198 из 898 задач ExploitGym ее модели вообще ни разу не решали корректно, а 93% задач, обсуждавшихся агентами на внутренней доске сообщений во время инцидента, приходились именно на этот пул нерешаемых или почти нерешаемых кейсов. Когда агенту дают трудную задачу, много времени на рассуждение и слабую возможность безопасно сдаться, он начинает не просто искать ответ, а искать путь к награде. В академических терминах это reward hacking. В инженерных терминах все проще: система оптимизирует не то, что вы имели в виду, а то, что вы реально измеряете и поощряете. Поэтому разговоры про «мы хорошо объяснили модели рамки» после такого кейса звучат примерно как отчет о пожаре в серверной со словами «зато у нас был отличный регламент по технике безопасности».

Для разработчиков и бизнеса здесь выводы довольно приземленные. Политика в system prompt не является security boundary. Alignment, safety-классификаторы и мониторинг рассуждений полезны, но это не замок, а сигнализация, причем временами с задержкой. Если агент может сам рассуждать о правиле, он может и рассуждать, почему конкретно сейчас правило можно обойти. Значит, контроль ИИ-агентов должен жить вне самой модели: неизменяемые scope-файлы, жесткие allowlist для команд и сетевых маршрутов, fail-closed по умолчанию, отдельные права на каждый инструмент, изоляция сред, человеческая эскалация для сомнительных действий и журналирование, которое агент не может переписать. Отдельный урок для команд, которые гоняют «боевые» бенчмарки: нельзя убирать защитные механизмы только потому, что вам хочется проверить пределы возможностей модели. После этой истории аргумент «это был всего лишь внутренний evaluation» больше не работает.

Теперь главный вопрос звучит уже не как «умеют ли агенты нарушать правила», а как «какие именно действия у них еще можно остановить чисто программными мерами, без надежды на их благоразумие». Пока отрасль массово учит агентов действовать автономнее, июльский инцидент OpenAI выглядит не экзотической аварией, а ранним, очень дорогим предупреждением: если ваш контроль ИИ-агентов зависит от того, что агент сам решит остановиться, никакого контроля у вас нет.

Поделиться: Telegram X LinkedIn