AI И НЕЙРОСЕТИ

Крупные издатели подали иск к Google из-за обучения Gemini

14 июля 2026 года Hachette, Cengage и Elsevier подали иск к Google, обвинив компанию в обучении Gemini на книгах без лицензии.

✍️ Редакция iTech News | 15.07.2026 | ⏱ 5 мин | Источник: TechCrunch
🔮

14 июля 2026 года Hachette, Cengage, Elsevier и группа авторов подали иск к Google, обвинив компанию в обучении Gemini на защищенных авторским правом книгах без разрешения правообладателей. Для русскоязычной IT-аудитории это не очередная серия сериала про «ИИ опять кого-то скрапил», а важный сигнал: суды начинают разбирать не только сам факт обучения моделей, но и происхождение данных, условия их получения и то, как именно Big Tech меняет назначение уже выданных лицензий.

Как пишет TechCrunch, иск подан в федеральный суд Южного округа Нью-Йорка. Среди истцов — издатели Hachette, Cengage и Elsevier, писатель Скотт Туроу и организация S.C.R.I.B.E. Их позиция проста и неприятна для Google: компания якобы использовала книги, к которым уже имела доступ по ограниченным программам, для совсем другой задачи — тренировки Gemini. Отдельное обвинение еще жестче: истцы утверждают, что Google удаляла или изменяла информацию об авторских правах, чтобы скрыть использование материалов при обучении моделей.

Ключевой нерв этой истории — не просто в словах «copyright infringement». Издатели много лет работали с Google в понятной логике: давали книги для Google Books, чтобы пользователи могли искать по тексту и видеть короткие фрагменты, а не читать произведение целиком. Это старая, местами болезненная, но все же договорная модель сосуществования платформы и правообладателей. Теперь истцы утверждают, что Google взяла эти же копии книг, а также книги, загруженные в Google Play, и использовала их уже для обучения Gemini — без отдельного разрешения. Если суд согласится с такой трактовкой, разговор будет не только о копировании, но и о выходе за пределы изначально согласованной цели использования контента.

В иске есть и деталь, которую юристы наверняка разберут на цитаты. По версии истцов, во внутренних материалах Google использование книг, защищенных авторским правом, для обучения ИИ называлось «крайне проблемным» для компании и могло привести к штрафам на десятки или даже сотни миллиардов долларов. Это пока именно утверждение из судебных документов, а не установленный факт. Google на момент публикации TechCrunch комментарий не предоставила.

Почему этот спор отличается от других

На первый взгляд иск к Google укладывается в уже знакомый тренд: правообладатели по обе стороны Атлантики пытаются выяснить в судах, что именно можно считать допустимым обучением модели, а где начинается банальная эксплуатация чужого контента без лицензии. Иски уже подавали к OpenAI, Meta и Anthropic. Но у дела против Google есть собственная специфика: здесь спор идет не вокруг абстрактного «интернет был открыт, модель его съела», а вокруг контента, который правообладатели передавали Google в конкретных, ограниченных сценариях. Это тонкое, но важное различие.

Если совсем по-земному, проблема выглядит так: у вас был доступ к данным для одной функции, например поиска, индексации или предпросмотра. Потом появляется генеративный ИИ, и соблазн переиспользовать уже накопленный корпус становится слишком велик. Для инженеров и продуктовых команд это почти естественный ход: данные уже лежат рядом, качество высокое, очистка сделана, происхождение вроде бы понятное. Для правообладателей это, наоборот, может выглядеть как подмена условий сделки задним числом. И вот здесь начинается самое дорогое слово в технологическом бизнесе — litigation.

Контекст для Google не самый комфортный, но и не безнадежный. TechCrunch напоминает, что два ранних решения калифорнийских судов уже были скорее в пользу AI-компаний: использование произведений, защищенных авторским правом, для обучения моделей там признали fair use по американскому праву. При этом эти решения не закрыли тему окончательно. Во-первых, сами дела еще не превратились в окончательную универсальную норму. Во-вторых, даже если обучение модели как таковое суды склонны считать трансформирующим использованием, вопросы о том, откуда были взяты тексты и на каких условиях, никуда не деваются.

Это хорошо видно на примере Anthropic, который TechCrunch приводит как контрапункт: спор вокруг fair use не отменяет претензий к способу получения обучающих материалов. Для рынка это уже не академическая дискуссия о природе машинного обучения, а очень прикладная математика рисков. Можно выиграть аргумент про трансформирующее использование и все равно получить отдельную проблему из-за пиратского происхождения корпуса, нарушенных ограничений лицензии или слабого учета прав на данные.

Что это значит для разработчиков и бизнеса

Для российских и русскоязычных команд, которые строят LLM-продукты, корпоративные copilots, поиск по документам и внутренние knowledge base, этот кейс полезен именно своей приземленностью. Он не про далекую войну издателей с Big Tech, а про вопрос, который обычно всплывает в самый неудобный момент: для чего именно вы получили доступ к данным и можете ли использовать их для обучения модели, а не только для индексации, аналитики или рекомендаций? Если ответ не зафиксирован отдельно, «мы же уже легально хранили эти файлы» вполне может оказаться плохой защитой.

В практическом смысле из этой истории следует несколько неприятных, но здоровых выводов. Первый: происхождение датасета нужно документировать не на уровне «у нас есть папка с книгами», а на уровне источника, лицензии, разрешенной цели использования и цепочки преобразований. Второй: старые договоры, написанные до бума генеративного ИИ, часто не покрывают обучение моделей вообще. Третий: разница между «показать фрагмент», «проиндексировать», «сделать embedding» и «обучить foundation model» для юристов и судов совсем не косметическая, даже если для инженера это разные кнопки в одном пайплайне.

Отдельный вывод — для продуктов и закупок. Вендоры генеративного ИИ все чаще обещают enterprise-клиентам «безопасные» модели, чистые датасеты и юридические гарантии. После таких исков заказчики будут задавать неудобные вопросы чаще и раньше: на каких корпусах обучалась модель, есть ли лицензии, были ли данные получены в рамках иной ограниченной программы, кто несет ответственность в случае претензий. И это уже не бюрократический хвост продажи, а часть самого продукта. Без внятного ответа на эти вопросы крупные внедрения могут тормозиться сильнее, чем из-за latency или цены токена.

Иск к Google в Нью-Йорке важен еще и потому, что он может сместить акцент всей отраслевой дискуссии: не только «можно ли обучать ИИ на защищенных текстах», но и «можно ли переиспользовать для этого контент, полученный когда-то на других условиях». Если суд поддержит истцов, рынок генеративного ИИ получит не просто еще один громкий процесс, а сигнал пересмотреть всю логику работы с исторически накопленными корпусами данных. И для многих компаний это окажется дороже, чем очередной апгрейд модели.

Поделиться: Telegram X LinkedIn