Иск к OpenAI и Microsoft подали ещё два американских издателя: The Seattle Times и Newsday. Они утверждают, что их журналистские материалы, включая тексты за paywall, использовали для обучения ИИ без разрешения и компенсации. Для IT-команд это не абстрактная битва медиа с Big Tech, а очередной сигнал: данные для обучения моделей становятся юридическим активом, а не бесплатным фоном интернета.
По данным Habr / Новости, заявление подано в Окружной суд США Южного округа Нью-Йорка. В иске говорится, что OpenAI и Microsoft собирали статьи с сайтов газет и включали их в обучающие датасеты для продуктов вроде ChatGPT, Microsoft Copilot и ИИ-сервисов Bing. Издатели требуют не только компенсации: они хотят судебного решения, которое обяжет компании уничтожить копии их работ, а также датасеты и модели, где эти материалы могли использоваться.
Формулировка жёсткая, но логика понятна. Газеты считают, что генеративный ИИ строит коммерческий продукт на чужой редакционной работе, а потом конкурирует с теми же редакциями за внимание читателя. В иске ИИ описывается как система, которая поглощает человеческий контент и возвращает рынку его копии или производные версии. Юристы любят драму не меньше маркетологов, но здесь за метафорами стоит вполне практический вопрос: можно ли обучать модель на защищённых текстах, если доступ к ним технически возможен, но лицензии нет.
Особенно болезненная часть претензии касается материалов по подписке. Если издатели докажут, что в обучающие наборы попадали не только открытые страницы, но и платный контент, спор выйдет за рамки обычного «интернет был доступен всем». Для медиа paywall — это не декоративная кнопка, а часть бизнес-модели. Для разработчиков ИИ — потенциальная зона риска: источник данных, способ его получения и условия использования становятся такими же важными, как архитектура модели или качество разметки.
Этот иск ложится в уже знакомую линию конфликтов. В 2023 году The New York Times подала в суд на OpenAI и Microsoft, также заявив о нарушении авторских прав. После этого претензии к разработчикам генеративного ИИ начали предъявлять и другие издатели. Рынок быстро разделился на два лагеря: одни идут в суд, другие заключают лицензионные сделки с ИИ-компаниями. Выглядит менее романтично, чем разговоры о будущем знаний, зато честнее: вопрос упирается в деньги, контроль и право решать, кто зарабатывает на редакционном труде.
В случае The Seattle Times есть дополнительная неловкость. По данным источника, OpenAI и Microsoft ранее финансировали ряд журналистских проектов и стипендий, связанных с этим издателем. Поэтому реакция Microsoft звучит предсказуемо: компания заявила, что удивлена иском, но готова обсуждать решение за столом переговоров. Перевод с корпоративного на человеческий простой: суд — неприятно, лицензия — обсуждаемо, публичный конфликт — лучше быстро упаковать в управляемый процесс.
Иск к OpenAI важен не только для юристов и медиаменеджеров. Если суды начнут требовать удаления материалов из датасетов или даже затронут уже обученные модели, это создаст сложный технический и продуктовый прецедент. Удалить конкретную статью из базы данных просто. Доказать, что её влияние исчезло из модели, намного сложнее. Для ML-инженеров это превращает вопросы происхождения данных, версионирования датасетов и аудита обучения из аккуратной документации в потенциальную линию защиты в суде.
Бизнесу тоже придётся привыкать к менее удобной реальности. Компании, которые внедряют генеративный ИИ, всё чаще будут спрашивать не только про качество ответов и стоимость токенов, но и про происхождение обучающих данных. Поставщик модели может обещать многое, но в контракте всё равно всплывут лицензии, indemnity, ограничения на использование контента и ответственность за претензии правообладателей. И да, это скучно. Но намного дешевле, чем выяснять всё после запуска продукта.
Для русскоязычной IT-аудитории этот спор полезен как ранний индикатор. Даже если американские судебные решения напрямую не регулируют российские компании, глобальные вендоры будут менять практики под крупнейшие рынки. Следом меняются API-условия, корпоративные политики, требования к закупкам и ожидания инвесторов. Иск к OpenAI показывает, что эпоха «соберём всё, что лежит в сети, а потом разберёмся» заканчивается быстрее, чем многим хотелось бы. Следующий большой вопрос — смогут ли суды и лицензии описать мир, где модель уже не хранит статью как файл, но всё равно извлекает из неё коммерческую пользу.
