БИЗНЕС И ЦИФРОВИЗАЦИЯ

20 крупных издателей атакуют архив Common Crawl — будущее AI под угрозой

Крупные издатели требуют закрыть архив Common Crawl, что может повлиять на обучение AI. Будущее моделей под угрозой.

✍️ Редакция iTech News | 25.12.2025 | ⏱ 2 мин | Источник: Habr / Новости
💼

Ассоциация комплексных издателей США, News/Media Alliance, направила официальное письмо в фонд Common Crawl с требованием закрыть его архив, используемый для обучения AI-моделей. Если требования будут удовлетворены, это может кардинально изменить подход AI-компаний к обучению, ставя под угрозу их доступ к открытому контенту.

Что такое Common Crawl

Common Crawl существует с 2008 года и каждый месяц архивирует открытый веб — десятки петабайт данных, размещенных в публичном доступе на Amazon S3. Архив используется многими AI-компаниями, включая OpenAI и Anthropic, для обучения своих языковых моделей. Например, до 60% знаний GPT-3 было получено именно оттуда. Парадоксально, но архив стал основным источником для многих AI, хотя его создатели изначально планировали использовать его для научных и исторических исследовательских целей.

Что требуют издатели

В письме к директору Common Crawl Ричу Скренте, ассоциация выдвинула четыре требования: удаление контента по запросу, публичное утверждение об отсутствии разрешения на использование архива для AI, изменение правил использования и добавление предупреждения для пользователей. Президент NMA, Даниэль Коффи, утверждает, что бесплатный доступ к контенту разрушает экономику медиа-индустрии, и ранее они уже боролись с обходчиками пейволлов.

Реакция самой организации Common Crawl на запрос не была обнародована, что добавляет неопределенности в вопрос доступности контента для AI.

Вероятные последствия для AI-компаний

Если требования издателей будут приняты, у AI-компаний появится необходимость заключать прямые соглашения с медиагруппами для получения доступа к контенту, что будет стоить денег. Альтернативой будет создание собственных краулеров, что потребует значительных ресурсов и времени. Блокировка доступа к архиву Common Crawl может также привести к потере доверия со стороны разработчиков к архивной экосистеме, которая работала на принципах открытого доступа на протяжении 17 лет.

Для российских AI-команд это значит, что придется заранее учитывать изменения в экономике доступа к контенту, а также возможное увеличение расходов на обучение моделей. Если архив станет платным или труднодоступным, это может повлиять на процесс разработки и внедрения AI-решений в стране.

Следующий шаг — реакция AI-компаний на требования издателей и возможные изменения в доступе к архивам. Как быстро он произойдет, зависит от динамики переговоров и юридических аспектов.

Поделиться: Telegram X LinkedIn