Claude Mythos Preview, по данным Anthropic, сумел превратить 8 из 18 патчей Firefox в рабочие эксплойты, причем первый результат появился меньше чем за час после выхода исправления. Для тех, кто отвечает за эксплуатация N-day в корпоративной защите, это неприятная новость: окно между публикацией патча и реальной атакой схлопывается быстрее, чем большинство компаний успевает собрать change advisory board.
Об этом сообщает The Hacker News в партнерской колонке инженера Picus Security Sıla Özeren Hacıoğlu, где собраны цифры из замеров red team Anthropic и других открытых источников. Ключевой тезис звучит жестко, но по делу: сам патч теперь все чаще становится инструкцией для атакующего. В diff видно, что именно исправили, а LLM-модель умеет достаточно быстро восстановить логику бага и собрать из нее PoC, пока инфраструктура заказчика еще живет по обычному графику тестов, окон обновления и запретов на внеплановый простой.
Самый показательный кейс в статье связан с Firefox. Anthropic проверяла модель только на публичном diff и двух сборках браузера, без дополнительных подсказок. Этого хватило, чтобы Claude Mythos Preview самостоятельно восстановил 8 рабочих цепочек удаленного выполнения кода из 18 исправлений. Причем первый эксплойт появился менее чем за час после релиза патча, а до выхода версии Firefox, которая должна была донести это исправление до пользователей, оставалось еще 18 дней. Для защитников это почти идеальный шторм: формально вендор уже все починил, фактически значимая часть инсталляций еще уязвима, а эксплуатация N-day уже готова к бою.
Еще неприятнее выглядят результаты по Windows. Там исследователи работали не с исходным кодом, а со stripped-бинарями и выводом декомпилятора, то есть в куда более тяжелых условиях. Тем не менее модель смогла построить proof-of-concept crash для 18 из 21 уязвимости ядра; самый быстрый результат занял 31 минуту. В 8 случаях цепочка дошла до привилегий SYSTEM, а ориентировочная стоимость такого результата составила около 2000 долларов за один кейс. Отдельная деталь, которая бьет по привычным приоритетам SOC и vulnerability management: одна из SYSTEM-цепочек была построена для бага, который Microsoft пометила как Exploitation Unlikely. Иными словами, шкалы, рассчитанные на ручную работу исследователя, начинают врать, когда в роли исследователя выступает модель.
На этом ломается старый сценарий «просто патчимся быстрее». The Hacker News приводит еще две цифры, которые делают картину совсем прозаичной. По Verizon 2026 DBIR медианное время исправления уже известных и эксплуатируемых уязвимостей выросло до 43 дней против 32 годом ранее, а полностью закрываются лишь 26% таких дыр. Даже у лучших команд в первую неделю уходит только 30-40% известных эксплуатируемых уязвимостей. На другом конце шкалы Zero Day Clock оценивает среднее время до появления эксплуатации в 2026 году уже меньше чем в 24 часа, тогда как в 2024-м речь шла примерно о 53 днях. Если ваши патчи идут по обычному enterprise-циклу, гонка уже проиграна по регламенту.
Отсюда и практический вывод для разработчиков, продактов и ИТ-руководителей. Бэклог из CVE с оценками 9.8 больше не помогает, потому что «критично» теперь почти все, а ресурсов на все равно нет. В статье это сформулировано вполне трезво: важен уже не вопрос «что у нас уязвимо?», а вопрос «что у нас реально эксплуатируемо в этой среде, остановят ли это текущие контроли и можем ли мы это доказать». Вендорский ответ Picus предсказуемо сводится к continuous validation: где можно безопасно запускать реальную цепочку атаки, запускать; где нельзя, разбирать эксплойт на TTP и проверять, ломается ли цепочка на EDR, сегментации, allow-listing или firewall; параллельно гонять актуальные техники против detection и prevention-стека, чтобы замечать дрейф правил до того, как его заметит злоумышленник. Это уже не столько разговор про patch management, сколько про доказуемую эксплуатируемость и устойчивость контролей.
Для русскоязычной IT-аудитории здесь, пожалуй, главный неприятный вывод не в том, что ИИ ускоряет атаки, а в том, что он обнуляет прежний запас времени. Там, где раньше между релизом патча и рабочим эксплойтом были недели или месяцы, теперь могут быть часы. Значит, приоритизация уязвимостей по CVSS без проверки реальной достижимости быстро превращается в ритуал, а споры между безопасниками, SRE и бизнесом о том, можно ли остановить прод ради экстренного обновления, будут возникать чаще. Следующий этап рынка выглядит довольно очевидно: меньше веры в формальные severity-метки, больше систем, которые умеют почти в реальном времени доказывать, что именно у вас уже можно взломать, а что пока держится на контролях.