Американские спецслужбы заявили, что китайские AI-компании тайно извлекали миллиарды токенов из Claude, GPT, Gemini и Grok. Для рынка это не очередная жалоба на «заимствование идей», а попытка описать дистилляцию ИИ-моделей как отдельную категорию киберриска. Для русскоязычных разработчиков и IT-бизнеса сигнал простой: доступ к API больших моделей теперь надо защищать не только от фрода и утечек ключей, но и от промышленного сбора обучающих данных.
По данным Dark Reading, совместное предупреждение 8 сентября выпустили ФБР, Агентство национальной безопасности США и CISA. В документе утверждается, что китайские компании с конца 2024 года извлекали «миллиарды токенов» через миллионы запросов к передовым американским моделям. Среди названных компаний — Alibaba, DeepSeek, MiniMax, Moonshot AI, StepFun и Z.AI. Среди предполагаемых целей — варианты Claude, GPT, Gemini и Grok, то есть модели Anthropic, OpenAI, Google и xAI.
Сама по себе дистилляция не криминал и не магия. В нормальной инженерной практике сильная «учительская» модель помогает обучить более компактную «студенческую»: дешевле в инференсе, проще встраивается в продукт, лучше работает на узкой задаче. Проблема, по версии американских ведомств, начинается там, где компании массово собирают ответы чужих коммерческих моделей, нарушают условия использования, обходят ограничения и превращают API конкурента в источник синтетических обучающих данных. Это уже не академический эксперимент в ноутбуке, а конвейер.
В предупреждении описаны и методы. Фирмы якобы покупали премиальные подписки крупными пакетами и делили доступ между командами разработчиков. Запросы проводились через нативные API, облачные провайдеры, сторонние агрегаторы и прокси-инфраструктуру, которая скрывает метаданные пользователя. Отдельно упоминаются «transfer stations» — серый рынок прокси для обхода географических ограничений и защитных механизмов. Если провайдер начинал блокировать один маршрут, система переключалась на другой. Это больше похоже на антифрод-баттл между платежным сервисом и ботнетом, только товаром становятся рассуждения модели.
Самая чувствительная часть обвинений касается извлечения reasoning-способностей. Ведомства говорят о попытках вытаскивать chain-of-thought-паттерны, тестировать качество ответов и обнаруживать защитные контрмеры. Другими словами, атакующий не просто спрашивает модель «напиши 1000 задач по Python». Он системно ищет, какие запросы раскрывают стиль рассуждения, доменные знания, форматирование, ограничения и устойчивые поведенческие шаблоны. Для владельца модели это неприятно вдвойне: дорогостоящая R&D-инвестиция превращается в обучающий материал для конкурента, а обычные лимиты по токенам выглядят слишком наивной стеной.
DeepSeek в сообщении выделен отдельно. CISA утверждает, что компания с конца 2024 года вела организованную кампанию против американских frontier-моделей, чтобы получать синтетические данные для собственных систем и снижать вычислительные и исследовательские затраты. Также в материале упоминается, что публично обсуждавшаяся стоимость обучения DeepSeek в $5,6 млн может не отражать полную цену разработки, если часть данных была получена через масштабную вредоносную дистилляцию. Это важная оговорка: регуляторы не приводят полноценную бухгалтерию разработки, но спорят с красивой легендой о почти бесплатном прорыве.
Moonshot AI, по утверждению американских агентств, извлекала данные Claude Fable 5 для обучения Kimi-K3 и данные GPT-4o для Kimi-K2. Формулировки здесь требуют аккуратности: речь идет об обвинениях ведомств, а не о судебно доказанном факте. Но сам список целей показывает, куда движется конфликт. Конкуренция в ИИ уже давно не только про GPU, дата-центры и таланты. Теперь это еще и борьба за то, кто контролирует потоки синтетических данных, телеметрию API и право использовать ответы модели как сырье для следующей модели.
Для разработчиков практический вывод приземленный. Если продукт активно использует LLM API, нужно смотреть не только на стоимость токенов, latency и качество ответов. Понадобятся лимиты на уровне аккаунтов и организаций, поведенческая аналитика, детектирование автоматизированного сбора, контроль массовой регистрации и обмен индикаторами между поставщиками. Эксперт Arctic Wolf Исмаэль Валенсуэла предлагает относиться к извлечению моделей и дистилляции как к самостоятельной категории инцидентов, а не прятать ее внутри «злоупотребления API» или спора об интеллектуальной собственности. Это звучит бюрократично, но для SOC и платформенных команд разница реальная: у отдельной категории появляются метрики, алерты, владельцы и playbook.
Для бизнеса история еще жестче. Компании, которые строят продукты поверх чужих моделей, рискуют попасть между двумя огнями: провайдеры будут ужесточать мониторинг и условия API, а клиенты начнут спрашивать, откуда взялись обучающие данные и не нарушают ли они чужие лицензии. Дистилляция ИИ-моделей остается полезным инженерным приемом, но вокруг нее быстро появляется контур безопасности, комплаенса и геополитики. Следующий спор на рынке AI, похоже, будет не о том, какая модель умнее в бенчмарке, а о том, кто сумеет доказать происхождение ее знаний и стоимость их получения.