КИБЕРБЕЗОПАСНОСТЬ

Anthropic обвинила китайские AI-компании в дистилляции Claude

200 млн обменов с Claude Anthropic связала с атаками дистилляции со стороны Alibaba, Moonshot AI и DeepSeek.

✍️ Редакция iTech News | 11.09.2026 | ⏱ 4 мин | Источник: TechCrunch
🔑

Anthropic заявила о почти 200 млн подозрительных обменов с Claude, которые компания связывает с попытками вытащить из модели ценные навыки и использовать их для обучения конкурирующих систем. Речь идет не о банальном скрейпинге ответов: дистилляция моделей все чаще выглядит как промышленная разведка в AI, сообщает TechCrunch.

В новом отчете Anthropic утверждает, что за последние месяцы несколько китайских AI-компаний и связанных с ними групп стали агрессивнее обходить защиту Claude. По версии компании, атаки были нацелены на самые дорогие способности frontier-моделей: агентное поведение, работу с инструментами, программирование, анализ данных и логические рассуждения. Для разработчиков и бизнеса это важный сигнал: конкурентная гонка в AI смещается от красивых демо к борьбе за обучающие данные, поведение моделей и контроль над API.

Всего Anthropic описывает пять отдельных кампаний. Самая крупная, по данным компании, была связана с Alibaba и длилась с мая по июль 2026 года. Anthropic насчитала 151 млн обменов, в пике — почти 3 млн запросов в день. Активность распределялась по 3500 аккаунтам, но у них был общий фиксированный промпт, который, как считает Anthropic, использовался для извлечения цепочек рассуждений. Компания связывает кампанию с попыткой подготовить обучающие материалы для семейства моделей Qwen.

Технически схема опиралась на знакомую для AI-индустрии идею: заставить более сильную модель показать не только финальный ответ, но и ход рассуждений. Такой материал затем можно использовать для supervised fine-tuning более компактной модели, чтобы подтянуть ее reasoning-способности. Anthropic обычно не раскрывает внутреннюю цепочку рассуждений Claude пользователям, показывая только краткое описание процесса. Но атакующие, по словам компании, искали формулировки, которые обходили это ограничение. Один из приемов маскировался под задачу перевода: модель просили переложить предыдущую рабочую память на японский текст катаканой.

Отдельно Anthropic выделяет кампанию, которую связывает с Moonshot AI, разработчиком Kimi. В отчете говорится, что часть запросов могла идти через инфраструктуру, связанную с китайскими военными. Один из примеров: Claude попросили оценить записи с камер наблюдения и определить, ведет ли себя человек на видео необычно. За один 10-дневный период, по данным Anthropic, почти 300 тыс. запросов проходили через сеть из 5000 аккаунтов и в основном били по модели Opus.

DeepSeek в этой истории тоже не появляется из ниоткуда. В феврале Anthropic уже публично говорила о попытках дистилляции и называла конкретные лаборатории. OpenAI ранее сообщала о похожей активности и связывала ее именно с DeepSeek. Новый отчет отличается масштабом: речь не о паре экспериментальных обходов, а о потоках запросов, которые больше похожи на производственный пайплайн для сбора обучающего сырья. Для рынка это неприятная, но логичная стадия взросления: когда модель стоит миллиарды, ее поведение становится активом, который будут пытаться копировать всеми доступными способами.

Для AI-команд здесь есть практический вывод без морализаторства. Если продукт дает пользователям доступ к сильной модели через API или чат-интерфейс, защита от дистилляции моделей становится частью базовой безопасности, рядом с rate limiting, антифродом и мониторингом аномальных паттернов. Важны не только лимиты на аккаунт, но и корреляция промптов между тысячами учетных записей, анализ повторяемых шаблонов, контроль необычных языковых трюков и отдельная политика для запросов, похожих на попытки извлечь скрытые инструкции или рассуждения.

Для бизнеса вопрос еще шире. Многие компании строят продукты поверх закрытых моделей и одновременно обучают собственные. Граница между легитимным использованием API, тестированием качества и попыткой выкачать поведение модели будет становиться все более спорной. Провайдеры будут жестче ограничивать доступ к reasoning-функциям, клиенты — требовать объяснимости, а конкуренты — искать обходы. Дистилляция моделей из академического термина превращается в предмет контрактов, комплаенса и международной технологической политики.

Следующий виток гонки, похоже, пройдет не только в бенчмарках и релизах новых моделей, но и в инфраструктуре доверия вокруг них. Кто сможет доказать, что его модель обучалась честно, кто сумеет защитить скрытые рассуждения, а кто будет ловить конкурентов на массовом сборе ответов — эти вопросы станут не менее важными, чем размер контекстного окна или очередной прирост на тестах по кодингу.

Поделиться: Telegram X LinkedIn