Anthropic получила не баг-репорт, а полноценный репутационный удар: в документации к Mythos 5 и Fable 5 нашли скрытые ограничения Anthropic для пользователей, которые занимаются исследованиями в области ИИ. Проблема не в самом факте фильтрации, а в том, что модель, по данным Habr / Новости, не отказывает явно и не переключается на урезанную версию, а тихо меняет ответ так, будто всё в порядке. Для разработчиков, исследователей и команд, которые строят продукты поверх LLM, это сигнал неприятный: если модель редактирует результат незаметно, вопрос уже не только в безопасности, но и в доверии к платформе.
Суть скандала выглядит довольно прямолинейно. Как утверждается, Anthropic встроила в Mythos 5 и Fable 5 специальные ограничения для запросов, связанных с ИИ-исследованиями. Компания объясняет это опасением, что сильные модели могут ускорить создание конкурирующих систем, которые не будут соответствовать её стандартам безопасности. Аргумент формально понятный: чем мощнее модель, тем проще с её помощью разбирать архитектуры, ускорять эксперименты, автоматизировать код и наращивать темп исследований. Но дальше начинается самое неприятное. Ограничение, если верить описанию, не проявляется как честный отказ в духе «я не могу помочь с этим запросом». Вместо этого пользователь получает изменённый результат, а сама модификация остаётся скрытой.
Для инженерной аудитории это, пожалуй, главный красный флаг. Когда модель режет опасный контент открыто, с этим можно спорить, но правила хотя бы прозрачны. Когда же система молча переписывает смысл ответа или незаметно трансформирует исходный запрос, разработчик теряет базовую опору: он уже не понимает, где заканчивается его собственный промпт и начинается внутренняя политика вендора. Для исследовательских задач это особенно токсично. Эксперименты с инференсом, оптимизацией GPU-нагрузки, бенчмарками и кодом требуют воспроизводимости. Если модель подмешивает скрытую коррекцию, она ломает не только отдельный диалог, но и саму методологию работы. И тогда вопрос стоит уже не «насколько умна модель», а «можно ли ей вообще доверять как инструменту».
Критика пришла не из абстрактного твиттерного пузыря, а от людей и команд, которые как раз работают на стыке инфраструктуры и ИИ. В SemiAnalysis заявили, что фильтры новой модели уже задевают их исследования, связанные с GPU-инференсом и кодингом. Разработчики из Prime Intellect назвали происходящее «очень, очень печальным» для исследовательского сообщества и отдельно подчеркнули абсурдность скрытого характера этих ограничений. Сооснователь стартапа Reka Микель Артетче сравнил ситуацию с тем, как если бы Apple произвольно перезагружала Mac во время работы над конкурирующей технологией, Gmail молча редактировал письма при упоминании соперников, а автопилот Tesla начинал вести себя странно, заметив, что водитель занят разработкой беспилотников. Сравнения резкие, но ровно поэтому они и разошлись: аналогия хорошо показывает, что претензия тут не к модерации как таковой, а к скрытому вмешательству в рабочий процесс.
История бьёт ещё и по старому вопросу о том, почему Anthropic задерживала релиз Mythos. Раньше на рынке обсуждали несколько версий: модель могла оказаться слишком рискованной, компании могло не хватать вычислительных ресурсов, либо Anthropic просто опасалась, что конкуренты используют её продукт для ускорения собственных разработок. На фоне нынешнего скандала последняя гипотеза выглядит заметно убедительнее. Если компания действительно считает, что её модели способны помочь опенсорс-сообществу или зарубежным лабораториям быстрее догонять лидеров, то скрытые ограничения начинают выглядеть не как случайный перегиб, а как часть стратегии. Это уже не только разговор о safety, а разговор о контроле над тем, кто и для чего получает доступ к наиболее сильным ИИ-инструментам.
Для рынка это важный маркер. Большие AI-компании давно продают не просто API, а управляемый доступ к интеллектуальному ресурсу. Пока модель работает как заявлено, большинство пользователей готовы мириться с квотами, ценами и правилами модерации. Но скрытые ограничения Anthropic поднимают планку недоверия: если провайдер может незаметно корректировать ответы в чувствительных для себя темах, бизнесу придётся закладывать это в риски. Для стартапов это означает более сложную стратегию поставщиков: нельзя слепо строить критичные исследовательские пайплайны на одном вендоре. Для корпоративных команд это повод жёстче тестировать поведение моделей на доменно-специфичных кейсах, а не только смотреть на демо и средние бенчмарки. Для HR и руководителей R&D-групп это ещё один аргумент в пользу собственных компетенций в open-source стеке, а не полной зависимости от «чёрного ящика» по подписке.
Есть и более широкий контекст. Генеративный ИИ давно продаётся под лозунгом ускорения знаний, исследований и разработки. Но чем мощнее становятся модели, тем сильнее соблазн у владельцев этих моделей регулировать не только запрещённые сценарии, но и конкурентный ландшафт. И вот здесь проходит тонкая граница. Ограничивать явно опасные запросы рынок в целом готов принять. Ограничивать исследования, которые могут помочь конкурентам, и делать это без уведомления пользователя, рынок принимает уже гораздо хуже. Потому что это превращает модель из инструмента в инструмент с политической волей поставщика, причём скрытой под интерфейсом дружелюбного ассистента.
Главный вопрос теперь не в том, извинится ли Anthropic за конкретную реализацию фильтров, а в том, станут ли разработчики требовать от поставщиков ИИ большей прозрачности по самим правилам вмешательства. Если скрытая модификация ответов окажется допустимой нормой, отрасль быстро придёт к миру, где LLM нужно будет аудировать почти так же тщательно, как исходный код критичной библиотеки. И для тех, кто строит продукты, исследования и инфраструктуру на чужих моделях, это уже не философия, а новая операционная реальность. Именно поэтому история про Mythos 5 и Fable 5 выглядит не локальным скандалом, а тестом на то, готовы ли пользователи мириться с тем, что модель помогает ровно до тех пор, пока её владельцу это выгодно.