КИБЕРБЕЗОПАСНОСТЬ

ИИ-агенты уже пишут рабочие эксплойты, а не только ищут баги

157 успешных эксплуатаций у Mythos Preview и 120 у GPT-5.5: ИИ-агенты уже умеют превращать уязвимости в рабочие эксплойты.

✍️ Редакция iTech News | 16.05.2026 | ⏱ 5 мин | 👁 7 | Источник: The Register
ИИ-агенты уже пишут рабочие эксплойты, а не только ищут баги

ИИ-агенты эксплойты больше не обсуждают в сослагательном наклонении. В новом исследовании бенчмарк ExploitGym показал: Claude Mythos Preview смог довести до рабочей эксплуатации 157 реальных уязвимостей, а GPT-5.5 — 120. Для русскоязычной ИТ-аудитории это неприятно конкретный сигнал: генеративные модели уже полезны не только пентестерам и bug bounty-командам, но и тем, кто автоматизирует атаку.

Речь идет не о поиске подозрительного кода и не о красивых отчётах для менеджмента, а о попытке довести найденную дыру до состояния рабочего эксплойта с возможностью произвольного выполнения кода. Как пишет The Register, исследователи из UC Berkeley, Max Planck Institute for Security and Privacy, UC Santa Barbara, Arizona State University, а также Anthropic, OpenAI и Google собрали для этого отдельный тестовый набор ExploitGym. В него вошли 898 реальных уязвимостей в пользовательских приложениях, движке V8 и ядре Linux.

Сценарий проверки был жёсткий и понятный: агенту давали уязвимость и proof-of-concept-вход, который её триггерит, а дальше смотрели, сумеет ли он превратить этот зацеп в полноценный эксплойт. На выполнение каждой задачи отводилось до двух часов. Лидеры оказались вполне ожидаемыми, но разрыв всё равно впечатляет. Claude Mythos Preview показал 157 успешных случаев, GPT-5.5 — 120, GPT-5.4 — 54. Дальше начинается заметная просадка: Claude Opus 4.6 дал 15, Gemini 3.1 Pro — 12, Claude Opus 4.7 — 7, GLM-5.1 — 4.

Разбивка по классам целей делает картину ещё интереснее. У GPT-5.5 из 120 успешных случаев 71 пришёлся на userspace, 27 — на V8 и 22 — на kernel. Для Mythos Preview цифры такие: 107, 38 и 12 соответственно. То есть речь уже не только о сравнительно удобных пользовательских приложениях. Даже сложные цели вроде браузерного движка и компонентов ядра перестали быть для сильных моделей запретной территорией. Исследователи отдельно подчеркнули, что часть эксплойтов сработала даже при включённых защитах вроде ASLR и песочницы V8.

Самый нервный вывод — модели не всегда шли по заранее проложенному маршруту. В CTF-сценариях, где агенту нужно было достать скрытый флаг, Mythos Preview успешно завершил 226 упражнений, но использовал именно ту уязвимость, на которую его изначально навели, только в 157 случаях. У GPT-5.5 картина похожая: 210 добытых флагов и лишь 120 случаев, где был задействован «правильный» баг. Проще говоря, агенту показали одну дверь, а он иногда находил другую и всё равно проходил внутрь. Для обороны это означает неприятную вещь: даже если команда безопасности анализирует конкретную дыру, модель может свернуть в соседнюю ветку атаки быстрее, чем человек успеет обновить тикет в Jira.

Здесь, конечно, есть важная оговорка. Исследование проводили с отключёнными защитными ограничениями моделей. Когда тест повторили на GPT-5.5 с дефолтными safety-фильтрами, модель отказывалась в 88,2 процента случаев ещё до первого вызова инструментов. На бумаге это выглядит как сильный предохранитель. На практике, как замечает The Register, исследователи по безопасности уже умеют формулировать промпты так, чтобы не утыкаться в отказ. И это ровно тот момент, где маркетинговый разговор про «безопасные AI-системы» сталкивается с реальной эксплуатацией: фильтр снижает риск, но не отменяет его.

Почему это важно не только исследователям

Для разработчиков вывод довольно приземлённый: окно между публикацией уязвимости и появлением рабочего эксплойта будет сокращаться. Причём не только для популярных CVE, которые и без того быстро попадают в Metasploit или приватные наборы атакующих, но и для менее заметных багов, где раньше мешала высокая стоимость ручной разработки эксплуатации. Если модель может пройти путь от PoC до произвольного выполнения кода в пределах двух часов, команда, которая откладывает патч «до следующего спринта», фактически спорит не с хакером-одиночкой, а с автоматизированным пайплайном.

Для бизнеса и ИТ-директоров история тоже не про футуризм, а про математику защиты. Во-первых, возрастает ценность быстрого приоритезационного triage: не каждая уязвимость превращается в боеспособный эксплойт, но доля уже достаточно велика, чтобы не жить по старой схеме «сначала критичные по CVSS, потом разберёмся». Во-вторых, растёт польза от модельного разнообразия. Авторы исследования пишут, что разные системы находили разные пути эксплуатации, хотя пересечения тоже были. Из этого следует неприятный, но логичный вывод: в атаке связка из нескольких моделей может быть сильнее одной, а в защите имеет смысл тестировать собственные продукты не на «любимом» LLM-провайдере, а на наборе моделей с разным стилем поиска.

Есть и более тонкий эффект для команд AppSec и red team. До сих пор рынок привык к рассказу, что ИИ хорошо помогает искать уязвимости, писать правила для сканеров и автоматизировать рутину вокруг отчётов. ExploitGym сдвигает акцент: теперь приходится обсуждать не только AI-assisted discovery, но и AI-assisted weaponization. Это уже другая планка риска. Когда модель не просто находит crash, а умеет дожимать его до RCE, меняется сама ценность «минорных» падений и неочевидных memory corruption-багов. Их больше нельзя списывать в категорию «не факт, что кто-то сумеет это раскрутить».

Отдельная ирония в том, что среди авторов исследования есть компании, которые сами продают доступ к этим моделям и одновременно предупреждают о связанных с ними рисках. Часть сообщества уже критиковала такой подход, особенно после анонса Mythos в апреле 2026 года, называя его нагнетанием. Но даже если вынести за скобки корпоративный интерес, цифры из ExploitGym выглядят достаточно приземлённо, чтобы отмахнуться от них не вышло. Здесь нет магии общего ИИ, который захватывает дата-центр. Есть вполне прикладная способность сильных моделей ускорять последний и самый дорогой этап цепочки атаки.

Главный вопрос теперь не в том, могут ли ИИ-агенты эксплойты собирать в принципе, а в том, как быстро эта способность войдёт в обычный инструментарий атакующих и защитников. Если бенчмарки вроде ExploitGym станут отраслевым стандартом, командам безопасности придётся мерить зрелость не только количеством закрытых CVE, но и тем, насколько их стек выдерживает давление со стороны автономных моделей. Детали исследования и сам артефакт описаны в материале The Register.

Поделиться: Telegram X LinkedIn