AI И НЕЙРОСЕТИ

Claude Fable 5 начал отказывать даже на слове «привет»

Anthropic признала, что фильтры Claude Fable 5 дают ложные срабатывания менее чем в 5% сессий, но пользователи жалуются на блокировку безобидных запросов.

✍️ Редакция iTech News | 11.06.2026 | ⏱ 5 мин | Источник: The Register
🧠

Новая модель Claude Fable 5 у Anthropic успела прославиться не качеством ответов, а странной подозрительностью: пользователи жалуются, что она уходит в отказ даже на обычное Hello. Для разработчиков и команд, которые встраивают ИИ в рабочие процессы, это неприятный сигнал: если модель срывается на безобидных запросах, проблема уже не в безопасности, а в предсказуемости продукта.

О сбоях Claude Fable 5 сообщает The Register. Anthropic заранее предупреждала, что настроила защитные механизмы консервативно: по словам компании, они иногда ловят безвредные запросы и в среднем срабатывают менее чем в 5% сессий. Но даже такой уровень выглядит болезненно, если речь идет о сервисе с аудиторией, которую издание оценивает в 18-30 млн пользователей по миру. При таких масштабах даже несколько процентов ложных блокировок быстро превращаются в поток жалоб, баг-репортов и раздражения в соцсетях.

Самый показательный пример привел Майк Фамуларе, principal research scientist в Institute for Disease Modeling, которое входит в Global Health Division фонда Гейтса. Он написал, что в Claude Code классификатор входного текста почти в каждой сессии на его аккаунте выдает model_refusal_fallback уже на первом сообщении, включая диалог, где единственный ввод пользователя — слово hello!. По его описанию, в этот момент в контексте еще нет ни содержимого репозитория, ни вызовов инструментов, ни чтения файлов. То есть фильтр срабатывает в максимально стерильной ситуации, где модели буквально не на что было бы обидеться.

Это не единичный случай. После релиза модели в GitHub-репозитории Claude Code появилось сразу несколько жалоб: на ложные срабатывания фильтров на безобидных сообщениях, на отказ помочь с редактированием резюме для позиции Application Security Architect, а также на ограничения при использовании в системах управления вне исследовательских лабораторий. В X иммунолог и профессор Jackson Laboratory for Genomic Medicine Дерья Унутмаз отдельно отметил, что слово cancer модель помечает как риск для биобезопасности. Похожие претензии появились и на Reddit. Для ИИ-продукта это уже не шум вокруг релиза, а довольно четкий паттерн: фильтры начинают путать профессиональную лексику с опасной активностью.

Почему это важнее, чем просто забавный баг

История неприятна не только тем, что модель перестраховывается. Куда важнее, что у Anthropic в этом релизе есть несколько уровней вмешательства, и часть из них происходит неочевидно для пользователя. The Register пишет, что классификаторы, которые должны ловить опасные запросы в кибербезопасности, биологии, химии и попытках дистилляции моделей, переводят запрос на более старшую модель Claude Opus, а пользователь получает уведомление. Это хотя бы понятная механика: система вмешалась, сервис сообщил, что именно произошло.

Но есть и другой слой защиты, связанный с попытками использовать модель для разработки конкурирующих frontier-моделей. В системной карточке Anthropic говорится, что в таких случаях компания может ограничивать эффективность ответа через модификацию промпта, steering vectors или parameter-efficient fine-tuning. Иначе говоря, модель может не отказать напрямую, а незаметно ухудшить результат. Разработчик Клей Мерритт на этом фоне сформулировал претензию жестко: по его словам, Anthropic фактически саботирует ответы на AI/ML-задачи без отказа и без уведомления, так что пользователь может даже не понять, что получил намеренно ухудшенный результат.

Для русскоязычной IT-аудитории здесь важен не только этический, но и вполне прикладной вопрос. Если компания строит внутренние инструменты на базе внешней модели, ей нужна понятная эксплуатационная логика: какие запросы режутся, какие понижаются, где будет фолбэк, а где молчаливая деградация. Когда система вместо ошибки выдает просто более слабый ответ, это бьет по отладке, по доверию команды и по качеству процессов. Особенно в сценариях, где ИИ используют для code review, security-анализа, подготовки архитектурных документов, работы с биомедицинской или юридически чувствительной терминологией.

Большие модели все сильнее делятся на «для всех» и «для доверенных»

Отдельный штрих к картине: Anthropic, судя по публикации, предлагает организациям из сферы киберзащиты и критической инфраструктуры использовать модель Claude Mythos 5. Она построена на той же базовой системе, что и Fable 5, но без такого набора ограничений. Правда, доступ к ней идет не по обычной подписке, а через программу Project Glasswing или через отдельную trusted access program, которую компания разворачивает для избранных исследователей в биологии. И это уже знакомый для рынка сценарий: массовому пользователю достается «безопасная» версия с заметными ограничениями, а более свободный режим выдается по допуску.

Основатель Abliteration.ai Девон, который помогает с удалением защитных ограничений у моделей, в разговоре с The Register заметил, что вокруг frontier-моделей действительно хватает и маркетингового нагнетания, и реальных рисков одновременно. Но его главный тезис куда шире конкретного релиза: Anthropic делает ставку на то, что пользователи будут достаточно доверять бренду и смирятся с отказами. Проблема в том, что для разработчиков и бизнеса терпимость к таким сбоям обычно быстро заканчивается. Если инструмент мешает работать с нормальной профессиональной терминологией или незаметно портит ответы на задачи вокруг ML, его начинают либо обходить, либо заменять.

В этом смысле Claude Fable 5 стал не просто спорным релизом, а хорошей иллюстрацией для всей индустрии. Гонка за безопасностью дошла до точки, где главный риск для вендора уже не в том, что модель скажет лишнее, а в том, что она начнет слишком часто молчать, паниковать или подменять поведение без ясного уведомления. Для рынка это означает простой критерий выбора: побеждать будут не те, кто громче всех обещает защиту, а те, кто сможет объяснить ее границы и не сломать нормальную работу продукта. Подробности кейса и конкретные примеры жалоб собраны в материале The Register.

Поделиться: Telegram X LinkedIn