Anthropic выпустила Claude Fable 5, но сразу поставила ему заметный ограничитель: публичная версия модели не отвечает на запросы по кибербезопасности, биологии и химии. Для рынка ИИ это важный сигнал: frontier-модели уже продают не только по мощности, но и по уровню риска, а доступ к самым сильным функциям все чаще превращается в историю про допуск, проверку и список доверенных пользователей.
О запуске 9 июня сообщает Ars Technica. По данным издания, Fable 5 стала первой моделью Anthropic класса Mythos и, по словам компании, в целом превосходит прежние frontier-модели линейки Opus. Но есть нюанс, без которого релиз выглядел бы совсем иначе: если пользователь задает вопрос по чувствительным темам, система перенаправляет запрос на более раннюю Claude Opus 4.8 и предупреждает, что это произошло. Иначе говоря, самый новый публичный Claude формально доступен всем, но в ряде прикладных сценариев разговаривает с вами уже не он.
Причина ограничений довольно прозрачна. Anthropic утверждает, что боится так называемого uplift-эффекта, когда модель заметно повышает возможности злоумышленника и помогает сделать то, что без нее было бы сложнее или дольше. Компания отдельно выделяет «агентный хакинг» — многошаговые атаки, которые модель способна планировать и выполнять лучше предыдущих поколений. Именно на кибербезопасности у нового семейства произошел один из самых заметных скачков: на бенчмарке ExploitBench модель Mythos 5 набрала 78% против 40% у Opus 4.8 и 69% у Mythos Preview. Для маркетинга это сильный аргумент. Для службы безопасности — уже не совсем маркетинг.
Защитный слой вокруг Claude Fable 5 построен на классификаторах, которые должны распознавать не только запрещенные темы, но и попытки обхода ограничений. Anthropic пишет, что провела более 1000 часов red-team-тестирования с багбаунти-программой, и внешние команды не нашли универсального jailbreak-метода для Fable 5. Кроме того, модель, по словам компании, заметно лучше прежних Opus сопротивляется автоматизированным попыткам взлома защит. При этом разработчик заранее признает, что фильтры настроены «строже, чем хотелось бы в идеале»: часть безобидных запросов тоже будет блокироваться. Внутренние тесты компании показывают, что такие ложные срабатывания возникают менее чем в 5% сессий. Обычному пользователю от этого не легче, но Anthropic явно решила, что раздражение легитимных клиентов дешевле, чем один громкий кейс с вредоносным применением.
Отдельно показательно, как расширился список опасных тем. Если раньше Anthropic ограничивала в первую очередь запросы, связанные с биологическим оружием, то теперь для публичной версии Fable 5 фильтр распространили на все запросы по биологии и химии. Логика компании в том, что даже на вид нейтральные вопросы по этим дисциплинам могут быть полезны для «хорошо обеспеченных злоумышленников», занятых рискованными биологическими исследованиями. Для разработчиков и исследовательских команд это означает простую вещь: чем сильнее модель становится в STEM-задачах, тем выше шанс, что доступ к ней будут дробить по ролям, индустриям и программам доверенного доступа. Универсальный чат-бот для всех постепенно уступает место многоуровневому продукту, где одинаковое название не гарантирует одинаковые возможности.
Здесь Anthropic попадает в довольно неудобную, но, похоже, уже неизбежную позицию арбитра. Компания прямо признает, что те же самые запросы, которые полезны специалистам по безопасности или ученым, могут быть опасны в руках злоумышленников. Поэтому доступ к полной версии Mythos 5 она пока оставляет только для «небольшой группы киберзащитников», которых сочли надежными в рамках Project Glasswing. В дальнейшем программу обещают расширять в консультации с правительством США. Параллельно готовится отдельный trusted access для организаций из life sciences: у них снимут биологические и химические ограничения, но сохранят фильтры по кибербезопасности. Если перевести с корпоративного на человеческий, рынок движется к модели, где frontier-ИИ будут продавать не как SaaS по подписке, а как инфраструктуру с проверкой личности, отраслевой ролью и, возможно, политическим согласованием.
Есть и более приземленный вопрос — цена. Для API и Enterprise-доступа Claude Fable 5 стоит 10 долларов за миллион входных токенов и 50 долларов за миллион выходных. В материале отмечается, что это на 67-100% дороже недавнего GPT-5.5 от OpenAI. На фоне разговоров о том, что пользователи и так болезненно воспринимают стоимость frontier-моделей, разница не выглядит декоративной. Более того, существующие подписки Anthropic включают доступ к Fable 5 только до 22 июня, после чего пользователям предложат отдельно покупать usage credits. Компания обещает вернуть модель в стандартные тарифы, когда у нее будет «достаточная емкость». Для бизнеса это знакомая картина: сначала громкий релиз, потом лимиты, очереди, кредиты и аккуратное напоминание, что самая интересная часть продукта пока существует в режиме controlled access.
Для русскоязычной IT-аудитории здесь важен не только сам релиз, но и новая продуктовая норма. Frontier-модель больше не обязана быть полностью доступной даже после публичного запуска. Поставщики ИИ начинают открыто признавать: если система слишком хороша в эксплуатации уязвимостей, химии или биологии, доступ к ней будут резать по темам, а не только по тарифам. Вопрос теперь не в том, появятся ли такие ограничения у конкурентов, а в том, кто первым научится превращать доверенный доступ в масштабируемый коммерческий процесс, не убив по дороге удобство для обычных разработчиков и команд.