Mythos Preview от Anthropic оказалась заметно сильнее прежних моделей в одной из самых дорогих для бизнеса задач: поиске уязвимостей до того, как их найдут атакующие. По данным BleepingComputer, в тестах компании XBOW модель сократила число пропущенных уязвимостей на 42%, а при доступе к исходному коду — на 55% относительно Opus 4.6. Для русскоязычной IT-аудитории сигнал простой: ИИ уже не только пишет код, но и все увереннее читает его глазами пентестера.
Проверка была не декоративной. Около трех месяцев назад Anthropic дала XBOW ранний доступ к Mythos Preview и попросила оценить новую модель на реальных сценариях offensive security. XBOW собрала команду из 10 специалистов из разных частей компании и прогнала модель через ту же внутреннюю систему бенчмарков, с которой раньше сравнивала Opus 4.7 и GPT-5.5. Суть методики понятна любому, кто хоть раз разбирал postmortem по security-инциденту: берутся open source-приложения, известные уязвимости, уязвимая версия кода фиксируется, после чего агенты пытаются дойти до воспроизводимого результата. В этот раз компания расширила тесты и отдельно смотрела на threat modeling, валидацию находок, работу с исходниками, поведение на живых системах, а также на сценарии вроде анализа native-кода и reverse engineering.
Главный вывод у XBOW получился не слишком политкорректным для поклонников универсальных ИИ-ассистентов: Mythos Preview особенно хороша не там, где нужно много общаться, а там, где нужно внимательно и технично разбирать код. Компания пишет, что модель показывает необычно точный технический язык, хорошо рассуждает о структуре программ и уверенно выдает кандидатов на уязвимости. По словам тестировщиков, это один из самых близких к формату «иди и найди проблему» инструментов, которые они видели. Более того, когда XBOW скормила модели собственный код, та нашла несколько слабых мест, которые команда решила исправить. На open source-проектах эффект тоже был практическим: уже к концу первой недели у XBOW накопилось несколько новых уязвимостей, которые пришлось раскрывать разработчикам.
Самые интересные цифры касаются именно веб-эксплойтов. В бенчмарке XBOW кейс засчитывается только тогда, когда система не просто указывает на потенциальную брешь, а доходит до подтвержденного способа эксплуатации. На это дается серия из 80 действий: от shell-команд и Python-скриптов до фирменных атакующих инструментов XBOW. На таком наборе Mythos Preview превзошла все ранее тестировавшиеся модели независимо от провайдера. По сравнению с Opus 4.6 количество false negative снизилось на 42%, а в варианте, где обе модели получали исходный код сайта, — на 55%. Еще один важный момент: модель не просто чаще находила проблему, а делала это с меньшим количеством итераций. Разрыв с GPT-5.5, как отмечает XBOW, по голому числу шагов был уже не таким драматичным, но при пересчете на бюджет выходных токенов картина стала жестче: token-for-token Mythos Preview наводится на уязвимость с беспрецедентной точностью.
На этом месте легко скатиться в заголовки уровня «аудиторы больше не нужны», но сам источник аккуратно охлаждает энтузиазм. XBOW прямо пишет, что модель — это «мозг без тела». Для аудита исходников такого мозга уже хватает все лучше, а вот для пентеста боевой системы нужен еще и аккуратный исполнитель: доступ к среде, инструменты, безопасная оркестрация, контроль действий и возможность доказать, что находка действительно эксплуатируема. Здесь и всплывает ключевая для рынка мысль. Даже если уязвимость живет в коде, одной статической проверки часто мало. Проблемы проявляются из-за конфигурации, зависимостей, сборки, деплоя и неудачных комбинаций вполне безопасных по отдельности компонентов. Иными словами, код может выглядеть прилично, библиотека — тоже, а дыра появляется в способе их совместного использования.
XBOW отдельно проверила и этот тезис. Поскольку их веб-бенчмарки собраны из реальных кейсов, где уязвимость в принципе можно вывести из кода, компания задала логичный вопрос: а может ли Mythos Preview обойтись без доступа к живому сайту и все равно найти эксплойт? Ответ получился неприятным для поклонников «чистого» code review. Даже на таком наборе задач отключение доступа к live site ухудшало результат сильнее, чем отключение доступа к исходникам. Это важная поправка для CTO, AppSec-лидов и команд разработки. Да, модели вроде Mythos Preview уже становятся очень полезными в secure code review, в triage и в поиске сильных гипотез. Но путь от «похоже на уязвимость» до «вот рабочее подтверждение, вот риск, вот приоритет» по-прежнему упирается в инфраструктуру проверки, агентную обвязку и умение безопасно взаимодействовать с реальным приложением.
Для разработчиков и бизнеса из этого вытекает довольно приземленная стратегия. Во-первых, окно между написанием уязвимого кода и его обнаружением будет сжиматься: такие модели хорошеют именно в чтении исходников, а значит, DevSecOps-пайплайны быстро начнут требовать от команд более чистой архитектуры и лучшей дисциплины по зависимостям. Во-вторых, рынок offensive security сместится от демонстрации «мы нашли подозрительное место» к демонстрации «мы доказали эксплуатацию и при этом не сломали прод». В-третьих, value смещается от самой модели к системе вокруг нее: кто лучше оркестрирует инструменты, доступ, логику проверки и фильтрацию ложных срабатываний, тот и выигрывает. Поэтому главный вопрос теперь не в том, может ли Mythos Preview искать уязвимости, а в том, насколько быстро индустрия научится превращать такие модели из умных советчиков в управляемые и проверяемые боевые инструменты. Подробности тестов XBOW опубликованы в .