AI И НЕЙРОСЕТИ

В Японии скупают подержанные книги тоннами для обучения ИИ

50 тонн японских книг могли отправить в США для сканирования ИИ. Букинисты фиксируют пятикратный рост заказов и тревожатся о рынке.

✍️ Редакция iTech News | 25.09.2026 | ⏱ 4 мин | Источник: Tom's Hardware
🎯

Сканирование книг для ИИ добралось до японских букинистов: отдельные магазины сообщают о днях, когда продажи через онлайн-площадки вырастали в пять раз, а книги уходили не коробками, а сотнями и даже тоннами. Для русскоязычной IT-аудитории это не история про старые тома на дальних полках, а свежий пример того, как гонка за обучающими данными начинает менять офлайн-рынки, авторское право и доступ к культурным архивам.

По данным Tom's Hardware, японский телеканал NTV зафиксировал волну подозрительных оптовых заказов у магазинов подержанных книг. Владельцы торговых точек рассказывают, что покупатели действуют через онлайн-маркетплейсы, оформляют крупные партии и часто указывают один и тот же пункт назначения: логистический центр в префектуре Окаяма. Оператор центра, по данным NTV, не стал отвечать на вопросы журналистов.

Самая заметная деталь - упоминание партии примерно в 50 тонн японских книг, которую, как утверждает NTV, отправили в США для сканирования и последующего уничтожения в процессе, связанном с Anthropic. В другом эпизоде букинистический магазин на западе Японии получил письмо от иностранной компании с запросом на покупку десятков тысяч книг. Это уже не закупка для университетской библиотеки и не коллекционерская охота за редкими изданиями. Масштаб больше похож на промышленную заготовку текстов.

Подозрения усиливает не только объем, но и ассортимент. Один из владельцев магазина в Токио рассказал NTV, что раньше лучше всего продавались романы и манга. Теперь же крупные заказы чаще приходят на философию, историю, политическую историю, медицину, право и книги о быте и культуре эпохи Эдо. Для разработчиков больших языковых моделей такой набор выглядит логично: художественная речь уже есть почти везде, а вот специализированные гуманитарные и профессиональные корпуса на японском языке куда ценнее.

Для самих магазинов ситуация двусмысленная. С одной стороны, выручка растет, складские залежи наконец превращаются в деньги, а редкий малый бизнес откажется от покупателей, которые забирают сразу сотни экземпляров. С другой - если значительная часть подержанных книг уходит из оборота навсегда, рынок быстро получает дефицит, рост цен и менее предсказуемый ассортимент. Букинистика держится не только на продажах, но и на постоянной циркуляции: книга куплена, прочитана, перепродана, снова нашла читателя. Шредер в этой цепочке работает как кнопка удаления.

Тренд не появился из воздуха. Ранее западные медиа уже писали о практиках, при которых посредники скупают физические книги, оцифровывают их для обучения моделей, а затем уничтожают экземпляры. Для AI-компаний это понятная инженерная задача: чем больше качественного текста, тем лучше покрытие языков, жанров, терминологии и культурных контекстов. Для книжного рынка и авторов это куда менее приятная математика: ценность создавалась десятилетиями, а согласие на использование часто никто не спрашивал.

Япония в этой истории особенно интересна из-за местного регулирования. Использование защищенных авторским правом произведений для машинного обучения там в целом допускается, если не доказано, что такое использование несправедливо вредит интересам правообладателя. На практике это оставляет широкий коридор для AI-разработчиков и их подрядчиков. Проблема в том, что массовая скупка через посредников делает процесс непрозрачным: автор, издатель и даже магазин не всегда понимают, станет ли книга частью обучающего корпуса или просто окажется у обычного читателя.

Для индустрии ИИ это еще один сигнал: вопрос данных уже давно вышел за пределы датасетов, GitHub-репозиториев и публичного веба. Модели конкурируют не только архитектурами и GPU-кластерами, но и доступом к редким, качественным, локальным корпусам. Японские подержанные книги ценны именно тем, что они не всегда хорошо представлены онлайн, особенно если речь о старых изданиях, узкой экспертизе или локальной исторической литературе. Ирония в том, что ради цифровой памяти можно физически уменьшить число доступных печатных экземпляров.

Для разработчиков и продуктовых команд здесь есть практический вывод без морализаторства. Данные для обучения - это не абстрактное топливо, а конкретные книги, авторы, рынки и правовые риски. Чем активнее компании скрывают цепочку поставки текстов за посредниками и логистическими центрами, тем выше шанс, что регуляторы, издатели и пользователи начнут требовать происхождение датасетов так же настойчиво, как бизнес уже требует происхождение кода в open source. Сканирование книг для ИИ может остаться легальной серой зоной, но серые зоны имеют неприятную привычку внезапно становиться дорогими.

Поделиться: Telegram X LinkedIn