Ассоциация комплексных издателей США, News/Media Alliance, направила официальное письмо в фонд Common Crawl с требованием закрыть его архив, используемый для обучения AI-моделей. Если требования будут удовлетворены, это может кардинально изменить подход AI-компаний к обучению, ставя под угрозу их доступ к открытому контенту.
Что такое Common Crawl
Common Crawl существует с 2008 года и каждый месяц архивирует открытый веб — десятки петабайт данных, размещенных в публичном доступе на Amazon S3. Архив используется многими AI-компаниями, включая OpenAI и Anthropic, для обучения своих языковых моделей. Например, до 60% знаний GPT-3 было получено именно оттуда. Парадоксально, но архив стал основным источником для многих AI, хотя его создатели изначально планировали использовать его для научных и исторических исследовательских целей.
Что требуют издатели
В письме к директору Common Crawl Ричу Скренте, ассоциация выдвинула четыре требования: удаление контента по запросу, публичное утверждение об отсутствии разрешения на использование архива для AI, изменение правил использования и добавление предупреждения для пользователей. Президент NMA, Даниэль Коффи, утверждает, что бесплатный доступ к контенту разрушает экономику медиа-индустрии, и ранее они уже боролись с обходчиками пейволлов.
Реакция самой организации Common Crawl на запрос не была обнародована, что добавляет неопределенности в вопрос доступности контента для AI.
Вероятные последствия для AI-компаний
Если требования издателей будут приняты, у AI-компаний появится необходимость заключать прямые соглашения с медиагруппами для получения доступа к контенту, что будет стоить денег. Альтернативой будет создание собственных краулеров, что потребует значительных ресурсов и времени. Блокировка доступа к архиву Common Crawl может также привести к потере доверия со стороны разработчиков к архивной экосистеме, которая работала на принципах открытого доступа на протяжении 17 лет.
Для российских AI-команд это значит, что придется заранее учитывать изменения в экономике доступа к контенту, а также возможное увеличение расходов на обучение моделей. Если архив станет платным или труднодоступным, это может повлиять на процесс разработки и внедрения AI-решений в стране.
Следующий шаг — реакция AI-компаний на требования издателей и возможные изменения в доступе к архивам. Как быстро он произойдет, зависит от динамики переговоров и юридических аспектов.