AI И НЕЙРОСЕТИ

Большой ИИ уперся в чужой контент и чужие лицензии

27 сентября The Register разобрал спор вокруг обучения ИИ на чужих текстах: суды проверяют границы fair use, лицензий и платного доступа.

✍️ Редакция iTech News | 28.09.2026 | ⏱ 5 мин | Источник: The Register
🧠

Контент для ИИ снова оказался не технической деталью, а главным юридическим и бизнес-риском генеративной индустрии. По данным The Register, новые материалы судебных споров вокруг OpenAI, Microsoft и GitHub показывают неприятную для рынка картину: модели обучались на чужих текстах, коде и медиа, а вопрос оплаты и лицензий часто оставался где-то за бортом. Для русскоязычных разработчиков и IT-бизнеса это не абстрактная американская драма, а сигнал: код, данные и тексты, которые сегодня выглядят «просто доступными в интернете», завтра могут стать предметом аудита, претензий и пересмотра процессов.

Поводом стала колонка Стивена Вона-Николса, опубликованная 27 сентября 2026 года. В ней автор собирает несколько линий одного конфликта: иск The New York Times против OpenAI и Microsoft, судебные документы, недавно ставшие публичными, и дело Doe v. GitHub, где обсуждались претензии к GitHub Copilot. Общий нерв простой: крупные AI-компании строят продукты на произведениях людей и компаний, но не спешат признавать, что у этих произведений есть владельцы, лицензии и экономическая ценность.

Самая жесткая часть истории связана с документами по делу The New York Times против OpenAI и Microsoft. В материалах, на которые ссылается The Register, фигурирует 92-страничный сводный документ истцов. Там, среди прочего, приведены слова директора Microsoft по прикладной науке Брента Хехта: спор он якобы описывал как кражу беспрецедентного масштаба. В этих же материалах упоминается внутренняя политика Microsoft, где генеративный ИИ описан как технология, способная подорвать занятость тех самых людей, чьи материалы использовались для обучения базовых моделей.

Важно не перепутать стадию процесса с вердиктом. Судья Сидни Х. Стайн из Южного округа Нью-Йорка еще не вынес решение по существу. OpenAI и Microsoft оспаривают претензии и опираются на аргумент fair use: по их позиции, использование публичных текстов и книг для обучения моделей продвигает знание и не является незаконной заменой рынку оригинальных материалов. Но публичность внутренних формулировок уже бьет по репутации. Даже если суд в итоге не примет логику истцов целиком, индустрия получила набор цитат, которые будет трудно «развидеть».

Отдельный эпизод касается платного доступа. В материалах дела, как пишет The Register, представитель OpenAI на показаниях не смог указать на усилия компании по выявлению или удалению paywall-контента из обучающих датасетов. Там же приводится реакция сооснователя OpenAI Грега Брокмана на сообщение о возможности обхода защиты: короткое одобрительное «ah, nice». Это не судебный приговор и не доказательство общей политики компании само по себе, но для издателей и медиа такой фрагмент звучит как приглашение идти в суд, а не на переговоры.

Проблема шире журналистики. Рынок уже привык к тому, что генеративные системы пересказывают статьи, делают иллюстрации, пишут рекламные тексты, помогают с документацией и кодом. Пользователь получает быстрый ответ и редко проверяет первоисточник. Один инженер OpenAI, по версии источника, формулировал это прямо: как бы заметно ни показывали ссылки, люди по ним не переходят. Для медиа это означает потерю трафика, для авторов — потерю видимости, для бизнеса — рост зависимости от систем, которые не всегда раскрывают происхождение результата.

С кодом ситуация еще нервнее. Девятый апелляционный суд США недавно дал GitHub, Microsoft и OpenAI ограниченную победу в деле Doe v. GitHub. Суд решил, что истцы не доказали нарушение конкретной нормы DMCA о снятии или изменении информации об управлении авторскими правами. Судья Эрик Миллер указал: если создается новое произведение и в него не включают сведения об авторских правах, это еще не обязательно означает, что такие сведения были удалены из существующего произведения.

Но это не означает, что Copilot или любой другой кодогенератор получил вечную индульгенцию на обучение на любом open source. Решение не установило, что копирование исходников в обучающую выборку всегда подпадает под fair use. Оно не решило, что сгенерированный код не может нарушать авторские права. И уж точно не отменило GPL, Apache, BSD, MIT и другие лицензии. Open source по-прежнему означает условия использования, а не «берите все и делайте что хотите, особенно если у вас достаточно GPU».

Для разработчиков практический риск выглядит буднично. Copilot, ChatGPT, Claude или другая система предлагает фрагмент кода, он проходит тесты, попадает в pull request, а дальше живет в продукте. Разработчик почти никогда не знает, мог ли похожий фрагмент быть взят из проекта под GPL или из библиотеки с условиями, несовместимыми с коммерческим продуктом. В обычной разработке это решается происхождением зависимостей, файлами LICENSE, SBOM и review. В AI-подсказках цепочка происхождения часто просто отсутствует.

Для компаний вывод менее приятный, чем очередной пресс-релиз про продуктивность. Если в разработке, маркетинге или поддержке активно используется контент для ИИ, нужны правила: какие инструменты разрешены, можно ли отправлять в них внутренний код, как фиксируется источник сгенерированного материала, кто отвечает за лицензионную проверку и где проходит граница между черновиком и production-артефактом. Без этого экономия на «быстром ответе» легко превращается в отложенный юридический долг.

Главный конфликт теперь не в том, умеют ли модели писать связный текст или рабочий код. Умеют. Вопрос в другом: сможет ли индустрия ИИ построить устойчивую экономику, если ее сырьевая база — книги, новости, репозитории, фотографии и документация — создается людьми, которым все чаще предлагают оплату в виде исчезающего трафика и красивых разговоров про прогресс.

Поделиться: Telegram X LinkedIn