Sony, EMI и Warner Chappell подали новый иск к Anthropic, утверждая, что компания незаконно скачивала и использовала защищенные авторским правом тексты песен, нотные сборники и песенники для разработки Claude. Для русскоязычной IT-аудитории это важный сигнал: суды в США все настойчивее проверяют не только то, что ИИ генерирует на выходе, но и то, откуда разработчики взяли данные для обучения, фильтров и внутренних вспомогательных моделей.
Как пишет Ars Technica, музыкальные издатели подали иск в пятницу и прямо связали действия Anthropic с ущербом для авторов песен, которым уже приходится конкурировать с ИИ-музыкой в чартах. По версии истцов, компания могла скачать «тысячи и тысячи» охраняемых произведений через пиратские библиотеки и торренты, а затем использовать этот массив в обучении, предобучении, синтетических датасетах, механизмах reinforcement feedback и даже в guardrails. То есть спор идет не о единичной утечке или неудачном ответе чат-бота, а о системной цепочке работы с контентом, где «грязные» данные могли попасть в коммерческий продукт разными обходными путями.
В жалобе фигурируют знакомые по предыдущему делу детали. Издатели напоминают, что Anthropic уже заключила историческое соглашение с авторами книг на 1,5 млрд долларов, признав пиратское использование более 7 млн книг для обучения ИИ. Теперь музыкальные правообладатели говорят примерно следующее: если после такого чека компания продолжает отбиваться аргументом о допустимом использовании, значит прежний удар не сработал как сдерживающий фактор. В иске даже отдельно подчеркивается, что 1,5 млрд долларов, по мнению издателей, недостаточно для компании, которая, как они утверждают, превратила массовое нарушение в бизнес с оценкой в 2 трлн долларов. Формулировка, мягко говоря, агрессивная, но она показывает градус процесса: речь уже не о философии fair use, а о цене нарушений в эпоху генеративного ИИ.
Самый неприятный для Anthropic фрагмент связан не с абстрактными юридическими теориями, а с внутренней перепиской. Истцы ссылаются на сообщения сотрудников, которые ранее всплыли в споре с авторами книг. По их версии, кампания с нелегальным торрентингом стартовала еще в июле 2021 года, когда сооснователь Anthropic Бенджамин Манн лично использовал BitTorrent для скачивания миллионов пиратских книг из LibGen. После закрытия LibGen, говорится в иске, сотрудники переключились на его клоны и зеркала, включая Z-Library и Pirate Library Mirror. В материалах дела упоминается, что Манн написал коллегам про появление зеркала «как раз вовремя», а в ответ один из сотрудников отреагировал фразой «zlibrary my beloved». Для суда это выглядит не как случайный доступ к спорному архиву, а как вполне осознанное и одобряемое внутри компании использование пиратской инфраструктуры для быстрой добычи обучающих данных.
Музыкальные издатели отдельно объясняют, почему их дело может оказаться для Anthropic опаснее книжного. В споре с авторами книг важную роль сыграл вопрос рыночного вреда: суд тогда не увидел убедительных доказательств, что модели Anthropic прямо замещают писателей на их рынке. С песнями и текстами ситуация менее комфортная для ИИ-компаний. Истцы утверждают, что Claude способен воспроизводить тексты песен, выдавать их без copyright management information, добавлять строки песен даже когда пользователь просил, например, только аккордовую последовательность, а также смешивать реальные тексты с синтетическими в «новых» композициях. В иске отдельно говорится, что модель может воспроизводить «сердце» произведения по широкому спектру запросов, включая стилистические переделки вроде превращения текста Eminem в песню «в стиле Beyonce». Для правообладателей это уже не академический спор о трансформативности, а прямой разговор о замещении работы автора и размывании роялти-пула.
Anthropic, как и ожидалось, не согласна. Представитель компании заявил Ars Technica, что это уже третий иск от тех же юристов, а сами претензии повторяют доводы из дел, которые суды уже рассматривают. Защита компании опирается на знакомую линию: обучение генеративных моделей — это трансформативное добросовестное использование, и Anthropic намерена активно защищаться. Но у издателей здесь есть неприятный для ответчика технический заход. Они не ограничиваются вопросом «использовались ли конкретно эти книги в коммерческом обучении Claude» и спорят о самом определении training. Если одна некоммерческая модель была обучена на текстах из LibGen или PiLiMi, потом генерировала synthetic data для другой модели, а та уже помогала коммерческому Claude, то граница между «не использовали напрямую» и «не использовали вообще» становится заметно менее четкой. Для инженеров и руководителей AI-продуктов это, пожалуй, главный вывод: юридический след теперь ищут не только в финальном датасете, но и во всей ML-цепочке, включая предобучение, промежуточные модели, safety-слои и вспомогательные наборы для оценки совпадений с исходным текстом.
Для рынка это плохая новость сразу в нескольких смыслах. Во-первых, дорожает комплаенс: компании придется документировать происхождение данных куда глубже, чем еще пару лет назад. Во-вторых, слабеет надежда на универсальный щит в виде fair use. Суд может признать трансформативность в одном классе контента и не признать ее в другом, особенно если выходы модели конкурируют с исходным рынком почти лоб в лоб. В-третьих, растет риск того, что правообладатели будут атаковать не только модель целиком, но и отдельные продуктовые функции: генерацию текстов песен, стилистические мэшапы, подсказки по аккордам с автоматическим добавлением лирики и любые режимы, где модель слишком хорошо помнит оригинал. Если эта логика приживется, следующим предметом спора станут уже не только датасеты, но и дизайн пользовательских сценариев. Детали и цитаты из иска собраны в материале .