AI И НЕЙРОСЕТИ

Anthropic пришлось раскрыть скрытые ограничения Claude Fable 5

319-страничная system card не спасла Anthropic от критики: пользователи Claude Fable 5 не видели, когда модель тихо переключали на Opus 4.8.

✍️ Редакция iTech News | 13.06.2026 | ⏱ 5 мин | Источник: ZDNet
💡

Anthropic выпустила Claude Fable 5 как публичную версию модели уровня Mythos, но быстро получила ровно тот скандал, которого обычно боятся разработчики платформ: пользователи думали, что тестируют одну систему, а в части сценариев на самом деле работали с другой. Для русскоязычной IT-аудитории история важна не из-за очередной драмы вокруг AI, а потому что бьет в базовый контракт между вендором и инженером: если модель меняет режим работы молча, результаты исследований, тестов и пилотов становятся сомнительными.

Как пишет ZDNet, проблема была не в самом наличии ограничений, а в способе их применения. Fable 5 вышла с защитными механизмами против рискованных сценариев в кибербезопасности, биологии и химии. В ряде случаев система честно показывала, что запрос понижается до уровня Opus 4.8. Но для некоторых задач, связанных с разработкой передовых LLM, проектированием особенно мощных чипов и узкими инфраструктурными сценариями, срабатывал другой режим: модель тоже откатывалась до Opus, только без явного уведомления в интерфейсе. Формально Anthropic это не скрывала совсем уж в ноль: соответствующее поведение было описано в 319-страничной Fable and Mythos System Card. Практически же это означает простую вещь: если вы не читаете документацию как роман на выходных, вы не знаете, какую именно модель сейчас дергаете через чат или API.

Контекст у этой истории тоже показательный. В апреле Anthropic представила Mythos в рамках Project Glasswing, партнерства с крупными технологическими организациями для поиска и исправления уязвимостей в интернет-инфраструктуре. Доступ к Mythos ограничили отдельными структурами, и логика тут понятна: инструмент, который умеет находить ранее неизвестные уязвимости для защиты, с тем же успехом может помочь находить их для атаки. Fable 5 стала фактически «приглушенной» публичной версией Mythos. То есть рынок получил не просто еще одну языковую модель, а продукт, который позиционируется на стыке AI и offensive/defensive security. В такой зоне доверие к режимам доступа, уровню возможностей и условиям деградации модели важно не меньше, чем сами бенчмарки.

Реакция оказалась резкой именно потому, что речь шла о молчаливом вмешательстве в исследовательский процесс. Fortune охарактеризовал поведение как secret sabotage, Wired тоже писал о практике тихого даунгрейда как о факторе, который может ломать работу AI-исследователей. Особенно болезненно это воспринимается в командах, где сравнивают качество модели на сложных задачах, строят пайплайны оценки и принимают продуктовые или исследовательские решения на основании наблюдаемого поведения системы. Если разработчик уверен, что проверяет Claude Fable 5, а фактически получает Opus 4.8, то результаты такой оценки уже нельзя считать чистыми. Это не вопрос «модель немного осторожничает», это вопрос валидности эксперимента.

Отдельно прозвучала критика со стороны security-практиков. Роб Т. Ли, chief AI officer и chief of research в SANS Institute, рассказал ZDNet, что при попытке создать навык для цифровой криминалистики его сессия была понижена до Opus 4.8. Его аргумент неприятен для любого вендора, который строит защитные барьеры: слой, останавливающий злоумышленников, одновременно может блокировать и тех, кто строит защитные инструменты нового поколения. И это уже не академический спор о safety, а прикладная дилемма для отрасли. Чем жестче фильтры у моделей, тем выше шанс, что blue team, SOC-инженеры, реверсеры и исследователи инцидентов начнут проигрывать по скорости тем, кто использует менее ограниченные инструменты. Ли добавил и более мрачную мысль: даже если доступ к мощной модели формально ограничен, внутри крупных организаций всегда остаются человеческие риски, от инсайдеров до скомпрометированных сотрудников.

Anthropic отреагировала быстро и довольно необычно для крупных AI-компаний: не стала делать вид, что ничего страшного не произошло. Компания сообщила ZDNet, что меняет safeguards для задач, связанных с frontier LLM development, и делает их видимыми. Начиная с этой недели, все помеченные запросы будут явно переключаться на Opus 4.8, а в API такие обращения станут возвращать причину отказа или ограничения. По словам Anthropic, текущие барьеры охватывают «несколько узких задач», включая пайплайны данных для frontier-scale LLM и kernel development для некоторых нестандартных чипов. Объяснение при этом предельно политизированное и техническое одновременно: США и союзники, по версии компании, пока сохраняют преимущество в передовых чипах и оптимизированном софте, а ограничения нужны, чтобы Claude не помогал это преимущество подтачивать, например при оптимизации чипов, разрабатываемых потенциальными противниками.

Для бизнеса и инженерных команд здесь есть несколько вполне земных выводов. Во-первых, эпоха «берем модель по API и считаем ее поведение стабильным» заканчивается: теперь нужно отдельно проверять, не меняется ли класс модели в зависимости от типа запроса, домена задачи и скрытых классификаторов риска. Во-вторых, system card на сотни страниц перестает быть факультативным чтением для AI-команд, которые работают в безопасности, инфраструктуре, железе и R&D. В-третьих, сам рынок, похоже, входит в фазу, где конкуренция идет не только по качеству вывода и цене токена, но и по прозрачности ограничений. Если вендор не может внятно показать, когда и почему он режет возможности модели, его продукты сложнее использовать в исследованиях, enterprise-пилотах и аудитах. Для российских разработчиков и продуктовых команд это особенно актуально: в условиях, где многие уже комбинируют западные и азиатские модели, фактор предсказуемости поведения быстро становится таким же важным, как latency, стоимость и поддержка tool use.

История с Claude Fable 5 вряд ли останется частным случаем Anthropic. Чем мощнее становятся публичные модели, тем чаще вендоры будут прятать внутри них сложные политические, правовые и отраслевые ограничения. Вопрос теперь не в том, будут ли guardrails, а в том, готовы ли поставщики AI честно показывать момент, когда у пользователя из рук забрали один инструмент и quietly подложили другой. Проверить исходные формулировки и реакцию компании можно в материале ZDNet.

Поделиться: Telegram X LinkedIn