Модель Claude Mythos от Anthropic успела заметно прибавить всего за месяц после первого анонса: обновленный checkpoint закрыл один киберполигон в 6 из 10 попыток и впервые для тестов британского AI Safety Institute прошел второй сценарий, пусть и только в 3 случаях из 10. Для русскоязычной IT-аудитории это не очередная красивая презентация про «умный AI», а сигнал куда практичнее: frontier-модели уже ускоряются не от релиза к релизу, а внутри одной версии, и это начинает менять разговор о реальных рисках в ИБ.
О новых результатах, как пишет ZDNet, сообщил UK AI Security Institute (AISI), который протестировал более свежую версию Mythos Preview. По данным института, новая сборка решила оба их киберсценария: полигон The Last Ones модель закрыла в 6 из 10 запусков, а Cooling Tower — в 3 из 10. Последний раньше не проходила ни одна модель в этой тестовой линейке. Для сравнения, AISI отдельно отмечает, что обновленный Mythos превзошел не только собственные прошлые результаты, но и OpenAI GPT-5.5. На фоне обычной риторики AI-компаний это уже не маркетинговая дымовая машина, а довольно неприятная для защитников инфраструктуры конкретика.
Контекст здесь важен. Когда Anthropic представила Mythos Preview и проект Glasswing месяц назад, компания сразу дала понять, что модель слишком мощная для широкого релиза. Доступ к ней получили только участники ограниченного альянса по кибербезопасности — Project Glasswing, куда вошли крупные техкомпании и AI-лаборатории. Тогда же AISI выпустил первую оценку и написал, что Mythos — это шаг вперед относительно предыдущих frontier-моделей на рынке, где способность AI выполнять киберзадачи и без того росла быстро. Сейчас британский институт фактически добавил к этому тезису неприятное уточнение: шаг вперед оказался не разовым, а продолжающимся, и гораздо быстрее, чем ожидалось еще несколько недель назад.
Главный нерв новости — не в том, что одна модель оказалась сильнее другой, а в скорости сдвига. AISI напоминает, что еще в феврале 2026 года внутри института оценивали рост длины киберзадач, посильных AI-моделям, как удвоение каждые 4,7 месяца с конца 2024-го. Для сравнения: в ноябре 2025 года у них была более медленная оценка — удвоение примерно каждые 8 месяцев. После появления Claude Mythos и GPT-5.5 обе траектории уже выглядят слишком консервативно. Иначе говоря, исследователи не просто увидели прогресс, а столкнулись с моделями, которые заметно вылезли за пределы их собственных прежних темпов. Для команд, отвечающих за AppSec, red teaming и защиту supply chain, это означает неприятную вещь: окна, когда новую способность модели еще можно считать лабораторной экзотикой, становятся короче.
При этом AISI не пытается продать публике сценарий немедленного цифрового апокалипсиса. В отчете прямо сказано, что пока неясно, идет ли речь о долгосрочном ускорении, или Mythos и GPT-5.5 — это пока скорее выбросы на общей кривой развития. Но даже такая оговорка звучит не успокаивающе, а аккуратно тревожно. Институт отдельно подчеркивает ограничения собственной методики: в тестах задачи ограничивали бюджетом в 2,5 млн токенов, чтобы сравнение моделей во времени оставалось более-менее честным. Проблема в том, что такой лимит, по словам исследователей, занижает реальные возможности frontier-моделей. У Claude Mythos и GPT-5.5 на самых длинных задачах из узкого кибернабора были почти стопроцентные показатели успеха, из-за чего верхняя граница их возможностей в этих тестах остается размытой.
Из этого следует особенно важный для инженеров вывод. Если модель почти безошибочно справляется с самыми длинными задачами внутри тестового набора, то дело уже не в том, «умеет ли» она, а в том, где именно у нее начнется деградация надежности. AISI признает, что их текущие задачи просто недостаточно длинные, чтобы это точно измерить. Более того, исследователи пишут, что без жесткого лимита по токенам успех на таких сценариях был бы еще выше — настолько, что расчет временных горизонтов выполнения задач становился бы бессмысленным. Для практики это звучит очень просто: если дать модели больше токенов и более взрослую агентную обвязку, она, вероятно, станет заметно полезнее и для защитных, и для атакующих сценариев.
Отдельная деталь, которую легко пропустить в потоке громких заголовков: в собственных киберэкспериментах AISI использует бюджеты до 100 млн токенов и пишет, что производительность, вероятно, продолжала бы расти и за этим пределом, особенно у последних моделей. То есть текущий потолок тестов — это скорее ограничение измерительного прибора, чем самой модели. Если перевести с академического на человеческий, индустрия приближается к моменту, когда привычные бенчмарки начинают отставать от объекта измерения. Для разработчиков это значит, что оценка AI по старым «табличкам с баллами» быстро теряет смысл. Для бизнеса — что внутренние политики доступа, песочницы, аудит агентных сценариев и контроль над использованием внешних моделей придется пересматривать чаще, чем это комфортно бюджетному циклу. Для HR и руководителей инженерных функций — что спрос на специалистов, которые понимают и offensive security, и поведение LLM-агентов, будет расти быстрее, чем рынок успеет их подготовить.
У Anthropic в этой истории тоже довольно понятная позиция: компания не выпускает Mythos в широкий доступ именно потому, что считает модель слишком мощной. Можно спорить, где здесь осторожность, а где удачный PR, но новые результаты AISI делают эту линию менее похожей на перестраховку. Если месяц назад рынок еще мог пожать плечами и списать разговоры про сверхспособности модели на эффект дефицита, то теперь у сторонних исследователей есть конкретные цифры, показывающие: прогресс не только есть, он еще и движется быстрее, чем сами наблюдатели закладывали в расчеты. Это уже не повод для паники, но и не та стадия, где уместно повторять мантру «генеративный AI пока часто ошибается». Ошибается, да. Но одновременно учится держать все более длинные и сложные киберцепочки.
Следующий вопрос для отрасли теперь звучит не как «сможет ли AI закрывать больше задач в ИБ», а как «успеют ли тесты, политики доступа и защитные процессы обновляться с той же скоростью, что и сами модели». Источник с деталями публикации — .