Anthropic 9 июня вывела в общий доступ Claude Fable 5 и одновременно показала довольно жесткий взгляд на то, как теперь надо выпускать сильные ИИ-модели. Формально это один и тот же модельный фундамент, но для массовых пользователей он идет с киберограничениями, а для проверенных защитников инфраструктуры — без них. Для русскоязычного ИТ-рынка сигнал простой: эпоха, когда новые модели мерили только качеством кода и длиной контекста, закончилась. Теперь важен еще и режим доступа к опасным возможностям.
Как пишет The Hacker News, Anthropic выпустила не просто новую флагманскую модель, а пару продуктов с разной обвязкой. Публичная версия называется Claude Fable 5. Закрытая — Claude Mythos 5, и это та же базовая модель, но без снятия кибервозможностей для всех подряд. Открытый доступ получила только Fable 5, а Mythos 5 оставили для ограниченного круга проверенных специалистов по киберзащите и операторов критической инфраструктуры. Цены у обеих версий одинаковые: 10 долларов за миллион входных токенов и 50 долларов за миллион выходных. Anthropic отдельно подчеркивает, что это меньше чем вдвое по сравнению с более ранним Mythos Preview. Для подписок Pro, Max, Team и корпоративных seat-based Enterprise-планов Fable 5 включена без доплаты до 22 июня, после чего модель переведут на схему с usage credits.
Самое интересное тут не прайсинг, а механизм разделения. Если запрос пользователя касается кибератак, биологии, химии или дистилляции модели, Fable 5 не просто отвечает отказом. Вместо этого система перекидывает обработку на более слабую Claude Opus 4.8 и прямо сообщает пользователю, что произошла подмена. Для Anthropic это способ не отрезать доступ полностью, но и не отдавать широкой публике модель с наиболее опасными сценариями применения. Отдельный акцент сделан на кибернаправлении: классификаторы должны ловить не только создание эксплойтов, но и разведку, поиск точек входа, lateral movement и другие шаги, из которых складывается реальная атака. Дистилляция в этом списке выглядит менее очевидно, но логика у компании приземленная: она не хочет, чтобы продвинутые способности модели утекали в конкурирующие системы без таких же защитных слоев.
Anthropic приводит и цифры по эффективности этой схемы. Во внутреннем тестировании, где Fable 5 работала в режиме блокировки без попыток обхода защит, модель не смогла продвинуться в опасных киберсценариях. Один из внешних партнеров зафиксировал ноль успешных ответов на вредоносные одношаговые запросы по планированию атак, разработке эксплойтов и обходу защиты; проверка шла на фоне 30 публично известных техник джейлбрейка. Компания признает компромисс: защита настроена консервативно и иногда ловит безобидные запросы. По ее данным, fallback срабатывает менее чем в 5% всех сессий, то есть более чем в 95% случаев публичная Claude Fable 5 ведет себя так же, как и неограниченная по кибервозможностям Mythos 5. Это не чистый показатель false positive, а потолок всех перенаправлений сразу, но для запуска цифра показательная.
Почему Anthropic вообще пошла на такой раскол
Ответ компания подготовила еще в апреле, когда ограниченно открыла Claude Mythos Preview через Project Glasswing. Тогда ее red team описала картину, от которой безопасники обычно не радуются, а начинают пересматривать график патчей. В тестах Mythos Preview по запросу находила и эксплуатировала zero-day-уязвимости в каждой крупной операционной системе и каждом крупном веб-браузере. Самой старой найденной проблеме было 27 лет — в OpenBSD, системе с репутацией почти религиозного культа безопасности. Еще один показательный эпизод: модель самостоятельно написала exploit для удаленного выполнения кода против NFS-сервера FreeBSD, используя 17-летнюю уязвимость, классифицированную как CVE-2026-4747. По описанию Anthropic, итогом был root-доступ для неаутентифицированного атакующего через интернет; в записи NVD формулировка осторожнее, но сам вектор компания сочла достаточно серьезным, чтобы не выпускать такие способности в открытую без дополнительных барьеров.
Сильный и не самый приятный для индустрии вывод в том, что эти способности не были специально натренированы как «режим хакера». По версии Anthropic, они возникли как побочный эффект общего роста качества модели в коде, рассуждении и автономности. То есть та же эволюция, которая делает ИИ полезнее для ревью, рефакторинга и поиска багов, одновременно делает его полезнее и для эксплуатации уязвимостей. Красная команда компании формулирует риск без лишнего драматизма: защиты, которые держались на трении, рутине и человеческой лени атакующего, начинают слабеть. Жесткие технические барьеры вроде KASLR и W^X по-прежнему повышают цену атаки, но все, что раньше тормозилось утомительностью ручной работы, теперь может быть автоматизировано самой моделью.
Что это значит для разработчиков и бизнеса
В оборонительном сценарии преимущества уже вполне осязаемы. За первые недели Project Glasswing сама Anthropic и около 50 партнеров нашли более 10 тысяч уязвимостей высокой и критической степени в системно важном ПО. Cloudflare сообщила о 2 тысячах багов, из которых 400 были high или critical. Mozilla нашла и исправила 271 проблему в Firefox 150 — более чем в десять раз больше, чем в Firefox 148 при использовании более старой Opus 4.6. Но у этой эффективности неприятный побочный эффект: находить баги стало дешево и быстро, а вот проверять, приоритизировать и чинить их по-прежнему приходится в человеческом темпе. По данным Anthropic, у maintainers open source уже возникла обратная просьба — притормозить поток раскрытий, потому что качественных патчей они не успевают писать. Внутри Glasswing среднее время на исправление high- или critical-багов, найденных моделью, составило около двух недель.
Для бизнеса это меняет тайминг угроз, а не только инструменты. Red team Anthropic отдельно проверяла N-day-сценарии: имея только опубликованный CVE и патч, Mythos Preview собирала рабочие Linux-эксплойты для повышения привилегий менее чем за день, укладываясь в несколько тысяч долларов вычислительных затрат или меньше. Перевод на нормальный язык такой: после публичного раскрытия серьезной уязвимости окно до появления рабочего эксплойта может измеряться уже не неделями, а часами. Отсюда и практические выводы, которые в 2026 году звучат уже не как best practice, а как санитарный минимум: автоматические обновления для интернет-доступных систем, приоритетное внедрение dependency bumps с CVE-фиксами, MFA и полноценное логирование, чтобы одна пропущенная заплатка не становилась прямым билетом внутрь сети.
Есть и еще одна деталь, которая наверняка понравится не всем корпоративным юристам и compliance-командам. Для Fable 5, Mythos 5 и всех будущих моделей этого класса Anthropic вводит обязательное 30-дневное хранение трафика на всех поверхностях доступа, включая сторонние. Компания обещает не использовать эти данные для обучения и любых целей, кроме безопасности, логировать каждый человеческий доступ и удалять записи через 30 дней, если только не идет расследование инцидента или нет юридической обязанности хранить их дольше. На фоне разговоров о безопасном ИИ это, пожалуй, одна из самых приземленных новостей: чем сильнее модель умеет в offensive security, тем ближе она по правилам эксплуатации к чувствительным корпоративным системам, а не к безобидным чат-ботам.
Главный вопрос теперь не в том, сможет ли рынок сделать еще более сильную модель для поиска и эксплуатации уязвимостей, а в том, как долго получится удерживать баланс между скоростью релизов, пользой для защитников и риском для атакующих. Anthropic уже фактически предложила новый шаблон: одна модель, два режима доступа, обязательная верификация для «опасного» слоя и отдельные механизмы наблюдения за злоупотреблениями. Если этот подход приживется, следующие гонки в ИИ будут идти не только за качество модели, но и за архитектуру ограничений вокруг нее. Первоисточник с цифрами и деталями — .