AI И НЕЙРОСЕТИ

Водяной знак Claude Fable 5.1 не видит главное для разработчиков

1 сентября 2026 года Anthropic выпустила Claude Fable 5.1 с текстовым водяным знаком, но в коде и точных ответах эта метка заметно слабеет.

✍️ Редакция iTech News | 02.09.2026 | ⏱ 4 мин | Источник: The New Stack
🧬

Anthropic 1 сентября 2026 года выпустила Claude Fable 5.1 и встроила в ответы модели водяной знак Claude — статистическую подпись, по которой можно оценить, участвовал ли Claude в создании текста. Проблема в том, что именно там, где русскоязычные разработчики чаще всего используют такие модели, эта схема работает хуже всего: в коде, правках готового текста и любых фрагментах, где важна точность, а не стилистический выбор.

Об этом сообщает The New Stack. Речь не о видимой метке и не о скрытых символах в тексте. Anthropic использует другой подход: модель слегка смещает выбор между несколькими допустимыми следующими словами, оставляя в ответе статистический рисунок. Компания утверждает, что для читателя такой текст не отличается от обычного, не требует дополнительных токенов и не повышает цену генерации. Но сама же оговаривает ключевое ограничение: если у модели нет свободы выбора, водяному знаку просто негде проявиться.

Для разработчиков это не академическая придирка, а вполне прикладная история. В коде, формулах, именах функций, сигнатурах, командах и фактических утверждениях модель не может безнаказанно «поиграть» с вариантом следующего токена. После конструкции вроде 2 + 2 = правильный ответ, мягко говоря, не слишком вариативен. Та же логика работает в программировании: если заменить нужный токен на «примерно похожий», код либо не скомпилируется, либо начнет вести себя неожиданно. Поэтому Anthropic прямо пишет, что в коде водяной знак обычно выражен слабее, а его влияние на собственно программный вывод должно быть пренебрежимо малым. Проще говоря, чем полезнее модель как инженерный инструмент, тем хуже она подходит для уверенного машинного «клеймения» результата.

Это важный разворот на фоне общего тренда последних месяцев. В июле 2026 года Anthropic вместе с другими крупными разработчиками ИИ подписала европейский кодекс практик по прозрачности AI-контента, а с 2 августа 2026 года для поставщиков ИИ, работающих на рынке ЕС, вступило в силу требование маркировать сгенерированные тексты. На этом фоне водяные знаки стали подаваться как компромисс между регуляторикой и удобством продукта: никакой плашки в интерфейсе, никакой лишней разметки, никакого ущерба качеству. В теории выглядит аккуратно. На практике получается, что метка лучше всего держится там, где текст можно перефразировать без потери смысла, и заметно хуже там, где ошибка слишком дорога.

Anthropic это не скрывает. В своем объяснении компания отдельно перечисляет зоны, где статистическая подпись ослабевает: короткие фрагменты, фактологические пассажи, вычитка чужого текста с минимальными правками и, собственно, код. Если пользователь дает модели документ и просит поправить только грамматику и пунктуацию, большая часть слов остается человеческой, а значит, следов для обнаружения может просто не хватить. Если модель переводит текст целиком, ситуация обратная: каждое слово выбирает Claude, и подпись должна проявляться сильнее. Отсюда неприятный, но логичный вывод: водяной знак Claude лучше выявляет масштабное участие модели в переписывании и генерации обычного текста, чем вмешательство в инженерные артефакты, где бизнесу и командам как раз хочется ясности.

Есть и второе ограничение, не менее существенное для бизнеса. Даже если водяной знак обнаружен, он не доказывает, что текст был написан ИИ «с нуля». Он показывает лишь вероятность того, что Claude в какой-то момент участвовал в обработке содержимого. Это может быть полностью сгенерированный ответ, а может быть тяжелая редактура исходника, созданного человеком. Обратное тоже верно: отсутствие водяного знака не означает, что текст точно человеческий. Он мог оказаться слишком коротким, слишком точно заданным или слишком сильно переписанным после генерации. Для внутренних политик компаний, которые мечтают о простой кнопке «проверить, писал ли это ИИ», новости здесь скорее отрезвляющие.

Для рынка разработки это создает довольно неудобную развилку. С одной стороны, регуляторы и корпоративные заказчики хотят прослеживаемости: кто, что и в какой степени сделал при помощи модели. С другой, лучшие сценарии применения LLM в engineering — код-ревью, генерация патчей, рефакторинг, автодокументация, исправление багов, правка SQL, работа с конфигами — как раз попадают в область, где статистическая маркировка ослабевает. Если перевести это на язык процессов, то надеяться только на водяной знак нельзя. Нужны журналы вызовов API, аудит действий агентов, контроль версий, политики для IDE-помощников и, в идеале, отдельные правила для текстового контента и для кода. Иначе компания получает формальное соответствие требованиям прозрачности, но не получает надежный способ разобраться, где именно в пайплайне ИИ реально вмешивался.

Отдельно показательно, что Anthropic подает обнаружение водяного знака через специальный API, а не как универсальную открытую проверку для всех желающих. Это уже намекает на реальную роль технологии: не магический детектор лжи, а еще один сигнал в цепочке комплаенса и расследований. Для редакций, платформ и образовательных проектов такой сигнал может быть полезен. Для инженерных команд, которые хотят автоматически маркировать AI-generated code, он выглядит куда менее убедительно.

На ближайшей дистанции спор, похоже, сместится с вопроса «есть ли у модели водяной знак» к вопросу «где этот водяной знак вообще имеет доказательную силу». И если ответ для кода, точных правок и фактологически жестких фрагментов остается расплывчатым, отрасли придется строить прозрачность не вокруг одной красивой метки, а вокруг более скучной, но рабочей связки из логирования, provenance-данных и дисциплины разработки.

Поделиться: Telegram X LinkedIn