AI И НЕЙРОСЕТИ

NYT обвинила OpenAI в сокрытии данных по делу о копирайте

78 млн обезличенных чатов и внутренний фильтр Bloom стали новым аргументом в иске против OpenAI по делу о копирайте и ChatGPT.

✍️ Редакция iTech News | 10.07.2026 | ⏱ 4 мин | Источник: TechCrunch
🎓

Иск против OpenAI по делу о копирайте вышел на новый уровень: The New York Times и Daily News заявили, что компания скрывала инструменты и массивы данных, которые могли показать, как часто ChatGPT воспроизводит чужие тексты. Для разработчиков, AI-команд и юристов в IT это уже не спор о красивой теории fair use, а вполне приземленный вопрос: что именно компания хранит, умеет искать и обязана показывать в суде.

По данным TechCrunch, издатели подали новое ходатайство о санкциях в рамках двухлетнего процесса против OpenAI. Суть претензии проста и неприятна: в суде компания долго утверждала, что не может полноценно искать по обучающему корпусу и что анализ огромного массива пользовательских диалогов был бы слишком тяжелым технически и рискованным с точки зрения приватности. Но на апрельской депозиции инженер по privacy Vinnie Monaco, как утверждают истцы, рассказал другое: OpenAI уже проводила внутренние поиски и оценки по обучающим данным, чтобы выявлять защищенные авторским правом журналистские материалы.

Самый чувствительный эпизод в этой истории связан не с абстрактными датасетами, а с вполне конкретными числами. По версии NYT и Daily News, еще до подачи иска OpenAI собрала базу примерно из 78 миллионов обезличенных разговоров ChatGPT и использовала ее внутри компании, чтобы измерять, насколько часто система заходит на чужую интеллектуальную территорию. После начала процесса, утверждают истцы, поверх этого набора появился Bloom filter в составе набора инструментов под названием Project Giraffe. Его задача была не философская, а прикладная: фиксировать случаи regurgitation, то есть когда модель не пересказывает своими словами, а выдает фрагменты, слишком похожие на исходный материал.

Отсюда и главный укол по позиции OpenAI. Если такие инструменты существовали, аргумент «мы не можем это надежно искать» начинает выглядеть слабее, чем хотелось бы защите. Истцы напоминают, что сначала просили выборку из 120 миллионов логов ChatGPT, а затем согласились сократить запрос до 20 миллионов. Эту выборку OpenAI передала суду только в декабре прошлого года, причем, по словам издателей, с таким объемом редактирования и вырезанных данных, что суд назвал образец фактически непригодным к использованию. На этом фоне новый тезис NYT звучит особенно жестко: компания якобы усложняла доступ к сведениям, которые уже давно умела собирать для себя.

Есть и еще один слой конфликта, который для отрасли, возможно, даже важнее самого копирайтного спора. Речь о процессе discovery, то есть о том, как стороны раскрывают доказательства. Издатели утверждают, что OpenAI после подачи иска удалила миллиарды ответов ChatGPT в нарушение судебного приказа о сохранении данных, а также подменила миллионы логов в требуемой выборке. Если суд сочтет, что компания действительно играла в прятки с доказательствами, последствия могут выйти далеко за пределы этого дела. Тогда обсуждать будут уже не только то, имела ли модель право учиться на новостях, но и то, можно ли доверять внутренним процедурам крупного AI-вендора, когда дело доходит до аудита, комплаенса и судебного контроля.

Запрос истцов к суду тоже предельно практичный и без литературных украшений. Они просят наказать OpenAI за сокрытие доказательств и манипуляции в discovery-процессе: не позволять компании опираться на выборку из 20 миллионов чатов как на надежное доказательство, считать установленным фактом, что логи ChatGPT показали бы существенное воспроизведение и использование контента истцов, запретить OpenAI спорить с тезисом о заметном regurgitation и взыскать с нее судебные расходы, которые издатели понесли, пытаясь добыть эти данные. Иными словами, иск против OpenAI может получить не только громкий медийный поворот, но и вполне конкретный процессуальный перекос в пользу газет.

OpenAI, разумеется, отвечает в противоположном регистре. Представитель компании Drew Pusateri назвал обвинения ложными и заявил, что The New York Times пытается получить доступ к приватным разговорам пользователей по мере ослабления собственной позиции в деле. Это важный контраргумент: OpenAI снова делает ставку на приватность и fair use, то есть на два столпа, вокруг которых AI-индустрия строит защиту уже не первый год. Проблема в том, что эти столпы начинают шататься, когда в материалах суда всплывают внутренние системы поиска, технические фильтры и десятки миллионов заранее подготовленных обезличенных диалогов. Для юристов и руководителей AI-продуктов здесь урок довольно циничный: если вы умеете что-то мерить внутри компании, рано или поздно кто-то спросит в суде, почему вчера это называлось стандартным внутренним контролем, а сегодня вдруг стало технически невозможной задачей.

Для русскоязычной IT-аудитории вся эта история важна не потому, что спорят американская газета и американская AI-компания. Она важна потому, что иск против OpenAI постепенно превращается в шаблон для будущих конфликтов между правообладателями и разработчиками генеративных систем. В центре теперь не только обучающие данные, но и вся инженерная обвязка вокруг моделей: хранение логов, обезличивание, фильтры на повторение контента, внутренние метрики качества, retention-политики и готовность показать все это под присягой. Чем крупнее становятся LLM-продукты, тем меньше шансов отделаться формулой «модель просто так сгенерировала». Следующая фаза рынка, похоже, будет строиться не на одних лишь лидербордах и демо, а на способности компаний доказать происхождение данных и объяснить, что именно их системы знают о чужом контенте и когда они это знание начали считать проблемой.

Поделиться: Telegram X LinkedIn