AI И НЕЙРОСЕТИ

Обучение ИИ на книгах: закон все еще догоняет рынок

Суд обязал Anthropic выплатить $1,5 млрд, но само обучение ИИ на книгах признал законным. Для разработчиков и бизнеса это важный сигнал.

✍️ Редакция iTech News | 24.08.2026 | ⏱ 5 мин | Источник: TechCrunch
🤖

Обучение ИИ на книгах все больше похоже не на черно-белую юридическую историю, а на затяжной разбор полетов с многомиллиардными ставками. Anthropic уже согласился выплатить $1,5 млрд по делу об использовании книг, но при этом суд в США не запретил сам принцип тренировки моделей на защищенных авторским правом текстах. Для русскоязычной IT-аудитории это важный сигнал: спор вокруг датасетов для генеративного ИИ идет не о морали вообще, а о том, где заканчивается допустимое использование контента и начинается банальное пиратство.

Как пишет TechCrunch, один из ключевых парадоксов рынка в том, что современные модели вроде ChatGPT, Gemini и Claude обучались на гигантских массивах опубликованных текстов: книгах, статьях, научных работах и веб-контенте. Значительная часть авторов не давала на это отдельного согласия и часто даже не знала, что их тексты попали в обучающие выборки. На бытовом уровне вывод кажется очевидным: если взяли чужие книги без разрешения, значит, это незаконно. Но американская судебная практика сейчас говорит куда менее прямолинейно.

Самый показательный эпизод связан с Anthropic. В одном из первых крупных решений такого типа судья Уильям Алсап в 2025 году признал законным обучение модели на опубликованных книгах без согласия авторов, но оставил в силе претензии к компании из-за пиратского происхождения части материалов; позднее Anthropic согласился выплатить $1,5 млрд в рамках мирового соглашения с авторами. Иначе говоря, проблема для суда была не в том, что ИИ «прочитал» защищенное произведение, а в том, что компания получила копии через пиратский канал. Логика Алсапа для индустрии почти комфортная: обучение модели он сравнил с тем, как писатель читает литературу, чтобы потом создать не копию, а новый текст.

Именно здесь проходит нерв всей дискуссии. Авторское право в США, как и во многих других странах, привязано прежде всего к копированию, а не к самому факту использования идей, чтения или анализа произведения. Юрист по интеллектуальной собственности Кэти Геллис прямо говорит, что для AI-компаний решение выглядит скорее хорошей новостью. Если суд принимает аналогию между обучением модели и чтением книги, то у разработчиков появляется рабочая правовая позиция: модель не воспроизводит книгу постранично, а извлекает статистические зависимости из огромного корпуса текстов. Для бизнеса это почти подарок, пусть и завернутый в дорогой судебный конверт.

Проблема в том, что на этой территории до сих пор действует закон 1976 года, а не нормы, написанные под эпоху LLM. Судьям приходится натягивать старые рамки на новую технику, которая переваривает триллионы слов и затем выдает текст, похожий на человеческий. Отсюда и разнобой в решениях. Старший юрист Джейсон Хендерсон, которого цитирует издание, описывает ситуацию без академической вежливости: суды пока блуждают в аргументации, потому что право просто не успело догнать вопрос о массовом обучении моделей на чужом контенте.

Чаще всего такие споры упираются в доктрину fair use, то есть добросовестного использования. Суд смотрит на цель использования, характер исходного произведения, объем заимствования и, что особенно важно, влияние на рынок. Если новая система использует чужой контент так, чтобы фактически подменить оригинальный продукт и откусить его выручку, у ответчика проблемы. Если же использование признают достаточно «трансформирующим», шансы на защиту выше. На практике это означает неприятную для правообладателей вещь: один и тот же корпус текстов может быть допустимым в одном сценарии и токсичным в другом.

Хороший контраст дает дело Thomson Reuters против Ross Intelligence. Там суд пришел к выводу, что использовать материалы Westlaw для создания конкурирующей AI-платформы нельзя, потому что у нового сервиса не было иной цели или иного характера использования. Проще говоря, если вы берете чужой контент, чтобы построить продукт, который будет лоб в лоб конкурировать с владельцем этого контента, ссылка на «трансформативность» работает заметно хуже. Для AI-стартапов это уже не философия, а практический критерий проектирования: вопрос не только в том, что вы используете для обучения, но и в том, какой именно продукт потом выводите на рынок.

Авторы, конечно, могут возражать, что чат-боты тоже начинают конкурировать с ними напрямую: генерируют тексты, пересказывают книги, имитируют стиль, а в перспективе способны завалить рынок синтетической прозой. Но, по состоянию на август 2026 года, такой аргумент еще не стал устойчиво выигрышным в судах. Это важная деталь для продуктовых команд: общественное раздражение вокруг генеративного ИИ очень высоко, но судебный стандарт пока не равен общественному возмущению. Между «это выглядит нечестно» и «это признано нарушением» лежит довольно длинная дорога из экспертиз, трактовок и апелляций.

Обучение ИИ на книгах осложняется еще и соседним вопросом: кому вообще принадлежат права на результат работы модели. В деле Thaler v. Perlmutter суд уже указал, что произведение, целиком созданное ИИ, не получает авторско-правовую охрану. А дальше начинается совсем веселая часть: где проходит граница между человеческим текстом с помощью ИИ и ИИ-текстом с минимальным участием человека? Если автор пишет роман в текстовом редакторе и пользуется проверкой орфографии, никто не говорит, что редактор стал соавтором. Но с генеративными системами этот комфортный здравый смысл быстро заканчивается.

Для разработчиков и IT-руководителей из этой истории следует несколько практических выводов. Во-первых, происхождение датасета становится не юридической сноской, а частью архитектуры продукта. Во-вторых, риск лежит не только в обучении, но и в рыночной модели сервиса: чем ближе продукт к прямой замене оригинального источника, тем хуже выглядит защита. В-третьих, compliance для AI-проектов скоро станет такой же обязательной функцией, как безопасность и приватность. Стартап, который в 2026 году все еще отвечает на вопросы о данных фразой «мы где-то это собрали», выглядит не дерзким, а плохо управляемым.

Главная интрига теперь не в том, можно ли одним словом назвать обучение ИИ на книгах законным или незаконным. Судебная практика, похоже, идет к более неприятному для всех, но и более реалистичному ответу: все зависит от источника данных, способа использования и того, с кем именно ваш ИИ собирается конкурировать. Для рынка это означает простую вещь: эпоха безразборного сбора контента не закончилась, но уже стала слишком дорогой, чтобы делать вид, будто юридических последствий не существует.

Поделиться: Telegram X LinkedIn