Безопасность данных ИИ перестала быть темой для слайдов юристов: крупные клиенты OpenAI и Anthropic уже ограничивают, какие модели можно использовать внутри компании и для каких задач. По данным Tom's Hardware, поводом стали вопросы к тому, какие данные и метаданные получают поставщики моделей, даже если контракт запрещает обучение на клиентских промптах.
Главная нервная точка — корпоративная интеллектуальная собственность. Компании опасаются, что в облачные ИИ-сервисы могут попадать код, архитектурные схемы, внутренние документы, данные о клиентах и логика бизнес-процессов. Формально OpenAI и Anthropic заявляют, что по умолчанию не обучают модели на данных корпоративных клиентов со специальными enterprise-контрактами. Но для покупателей этого уже мало: им нужен не маркетинговый ответ «мы не обучаемся на ваших данных», а точная карта того, что именно собирается, где хранится и кто это может читать.
История обострилась после июньского изменения политики Anthropic для флагманской модели Fable. После обновления компания может сохранять клиентские данные, объясняя это борьбой со злоупотреблениями. Логика понятна: если модель используют для вредоносных сценариев, провайдер хочет иметь инструменты расследования и блокировки. Но для бизнеса это звучит менее уютно: если данные можно удерживать для контроля безопасности, значит чувствительная информация потенциально попадает в тот самый контур, от которого ее хотели изолировать.
Отдельная проблема — метаданные. OpenAI и Anthropic, по данным материала, собирают техническую информацию об использовании сервисов корпоративными клиентами. OpenAI описывает это как способ лучше понимать работу сервисов, Anthropic говорит об агрегировании и анонимизации таких данных и утверждает, что метаданные не идут на обучение моделей. Но клиенты упираются не только в сам факт сбора, а в туман вокруг состава этих данных. Для зрелого IT-департамента «техническая телеметрия» — слишком широкий зонтик: под ним могут оказаться названия подключенных приложений, частота обращений, типы сценариев, интеграции и косвенные признаки внутренних процессов.
Показательный кейс — телеком-компания C Spire. У нее есть соглашения с OpenAI и Anthropic, запрещающие использовать ее данные для обучения моделей. При этом контракты допускают сбор технических данных об использовании. C Spire считает, что туда могут входить сведения о приложениях, к которым подключены ИИ-модели, и другая эксплуатационная информация. Компания также хочет понять, собирают ли поставщики данные о том, что модель делает между получением запроса и выдачей ответа, то есть о внутренних рассуждениях. OpenAI заявляет, что не использует такие данные для обучения моделей, но для C Spire проблема остается: объяснения, по ее оценке, недостаточно прозрачны.
Часть клиентов отвечает на неопределенность старым добрым способом: забирает ИИ ближе к себе. Northrop Grumman, по данным The Information, запускает open-source-модели на собственных изолированных серверах с физическим или сетевым разрывом от внешних контуров. Это не самая дешевая и не самая удобная схема, зато понятная людям, которые отвечают за оборонные и критические системы. В ней меньше магии облака и больше скучных, но проверяемых границ.
Microsoft пытается превратить этот страх в продажу: компания предлагает изолированные облачные среды, где модели работают на частных серверах и не отправляют данные внешним ИИ-поставщикам. Такой подход дорогой, и, судя по источнику, как минимум один клиент еще только оценивает переход. Зато направление очевидно: корпоративный ИИ начинает делиться не только по качеству модели и цене токена, но и по степени изоляции. Для российского рынка с его любовью к on-prem, закрытым контурам и болезненным проверкам регуляторов это звучит до боли знакомо.
Novo Nordisk выбрала промежуточный вариант: компания продолжает использовать Claude для части задач, но запрещает передавать модели проприетарные данные. Nvidia тоже ограничила применение Fable задачами, где нет доступа к чувствительной информации. Причина та же — отсутствие необратимой политики нулевого хранения данных, или ZDR. При этом внутри Nvidia есть собственное ИИ-решение для более закрытых сценариев. Ирония заметная: Дженсен Хуанг ранее призывал сотрудников активно тратить ИИ-токены, но даже в компании, которая зарабатывает на ИИ-инфраструктуре больше многих, энтузиазм упирается в правила доступа к данным.
Недоверие уже бьет по пилотам. Крупная американская коммунальная компания, как сообщается, отказалась тестировать Anthropic Fable для задач, связанных с основной энергетической инфраструктурой, после того как Anthropic не согласилась на необратимый ZDR-режим. Для поставщиков моделей это неприятный сигнал: корпоративный клиент может быть готов платить за ИИ, но не готов приносить в жертву контрактную определенность. Особенно если речь идет не о генерации писем, а о коде, инженерных системах, сетях, фарме, телеком-инфраструктуре или энергетике.
Для разработчиков и IT-директоров вывод практичный: безопасность данных ИИ теперь надо проектировать так же внимательно, как доступы к базам, CI/CD и журналирование. Нужны списки разрешенных моделей, классификация данных, отдельные правила для кода и клиентской информации, понятные DPA и проверяемые настройки retention. Следующий этап рынка, похоже, пройдет не под лозунгом «у кого модель умнее», а под вопросом: кто сможет доказать, что корпоративные данные не превращаются в побочный продукт чужой платформы.