КИБЕРБЕЗОПАСНОСТЬ

OpenAI пресекла кампанию по извлечению reasoning из своих моделей

16 000 запросов за два дня: OpenAI заявила о срыве кампании по извлечению скрытых рассуждений из AI-моделей.

✍️ Редакция iTech News | 02.10.2026 | ⏱ 4 мин | Источник: The Hacker News
🚨

OpenAI заявила, что пресекла скоординированную кампанию на 16 000 попыток запросов за два дня, цель которой — извлечение рассуждений из ее AI-моделей. Для разработчиков и компаний, строящих продукты поверх LLM, это неприятное напоминание: модель можно атаковать не только через взлом инфраструктуры, но и через грамотно поставленные вопросы.

По данным The Hacker News, OpenAI связала «ядро» активности с людьми, ассоциированными с Moonshot AI, китайской AI-компанией из Пекина. При этом компания не привела публичных технических доказательств такой атрибуции, вероятно, по соображениям безопасности. Это важная оговорка: обвинение звучит серьезно, но читателю не показывают логи, индикаторы или методику, по которой OpenAI пришла к выводу о связи с Moonshot AI.

Сама атака, по версии OpenAI, не была классическим взломом. Злоумышленники не ломали шифрование, не получали доступ к базе данных и не читали сохраненные пользовательские диалоги напрямую. Вместо этого они манипулировали взаимодействием с моделью так, чтобы защищенные рассуждения воспроизводились в видимом для requester виде. Проще говоря, пытались заставить систему показать то, что обычно скрыто за пользовательским ответом.

Активность началась 1 июля 2026 года с небольших объемов, а затем резко выросла 24 и 25 июля: OpenAI насчитала 16 000 попыток запросов с релевантным паттерном извлечения более чем от 4 000 пользователей. После дополнительного анализа компания нашла похожие prompt-pattern-активности уже более чем у 15 000 пользователей. Полностью кампанию, по ее словам, остановили 28 июля 2026 года.

OpenAI описывает происходящее как adversarial distillation — несанкционированное использование выходов одной модели, чтобы обучить, воспроизвести или улучшить другую. В обычной инженерной практике дистилляция может быть легитимным способом сделать меньшую модель быстрее и дешевле. Но здесь речь о попытке вытащить защищенное поведение чужой системы, причем в масштабе. Если финальный ответ модели — это витрина, то скрытые рассуждения ближе к внутренней кухне: по ним можно понять, как система приходит к решению, где у нее ограничения и какие safeguards срабатывают до публикации ответа.

После инцидента OpenAI заблокировала связанные аккаунты и добавила новые меры защиты. Компания также закрыла путь, который позволял пользователю, уже имеющему зашифрованные рассуждения другого пользователя, повторно проиграть их и восстановить содержимое. Отдельно OpenAI усилила проверки потокового вывода, чтобы задерживать ответы, которые могут случайно раскрыть reasoning. Для API-команд это звучит как скучная внутренняя гигиена, но именно такие детали потом определяют, превращается ли уязвимость в массовую схему.

Контекст делает историю еще острее. В августе 2026 года исследователи из MATS Research, ELLIS Institute Tübingen и Synk описали архитектурную проблему у Claude, Gemini и GPT: зашифрованные следы рассуждений могут быть совместимы между сессиями, пользователями и моделями внутри экосистемы одного провайдера. В их сценарии атакующий переносит encrypted reasoning trace в более слабую и менее защищенную модель того же поставщика и заставляет ее вывести содержимое в открытом виде. Это не выглядит как эффектный jailbreak из кино, зато масштабируется куда лучше.

Риски здесь не ограничиваются «кто-то украл красивые цепочки мыслей». По словам OpenAI, извлеченные рассуждения могут помочь обучить другую модель без тех ограничений безопасности, которые стоят на оригинальной системе. В dual-use-доменах — кибербезопасность, биология, химия, автономные агенты — такая утечка ускоряет перенос возможностей без сопоставимых инвестиций в safety. Для бизнеса это означает, что защита AI-продукта теперь включает не только контроль ключей API, лимиты и антифрод, но и мониторинг паттернов запросов, которые выглядят как методичная разведка модели.

Для Moonshot AI история тоже не первая неприятная. В прошлом месяце Anthropic обвинила компанию в том, что та якобы скрытно пересылала пользовательские запросы в Claude вместо обработки через Kimi, показывала ответы Claude своим пользователям и сохраняла часть таких обменов для обучения chain-of-thought-модели. Эта активность отслеживалась как GTG-16002. Moonshot AI в источнике этой новости не получает отдельной прямой цитаты, поэтому обвинения лучше читать именно как позицию конкурентов и OpenAI, а не как установленный регулятором факт.

Главный вывод для отрасли неприятно практичный: конкуренция между AI-лабораториями смещается от бенчмарков и ценников к борьбе за скрытые вычислительные следы моделей. Чем дороже становятся frontier-системы, тем больше стимул не строить аналог с нуля, а вытащить из чужой модели то, что обычно не видно пользователю. Следующий большой спор вокруг LLM может быть не о том, кто лучше отвечает, а о том, кто сумеет доказать происхождение этих ответов.

Поделиться: Telegram X LinkedIn