AI И НЕЙРОСЕТИ

Как архивисты из Пакистана обучили ИИ спасать редкие книги

За 10 лет команда сняла 526 тысяч разворотов и довела Nikon до 902 тысяч срабатываний, чтобы сохранить 1800 редких книг на урду.

✍️ Редакция iTech News | 31.08.2026 | ⏱ 5 мин | Источник: Tom's Hardware
🔬

За десять лет трое энтузиастов из Пакистана сняли 526 тысяч разворотов, довели две недорогие камеры Nikon до суммарных 902 тысяч срабатываний затвора и собрали цифровую библиотеку из 1800 редких книг на урду. Эта оцифровка редких книг важна не только для библиотекарей: история показывает, что прикладной ИИ иногда рождается не в дата-центре с миллиардным бюджетом, а из десятков тысяч вручную исправленных ошибок и очень упрямой команды.

Проект Ibteda Digital Library стартовал примерно в 2015 году, когда трое друзей решили своими силами сохранять книги, которые уже вышли из печати. Как пишет Tom's Hardware, никакого внешнего финансирования у них не было: книги покупали за свои деньги, снимали сначала на Nikon D5300, со светом от LED-ламп и стеклом от копира, которым прижимали страницы. На выходе получалась не красивая фотография для соцсетей, а сырье для архивной копии, где важны одинаковые поля, размер текста, ориентация страницы и повторяемая геометрия по всей книге.

Именно здесь начинается та часть истории, которую хорошо поймут разработчики. Сфотографировать книгу, даже редкую и хрупкую, оказалось не самой страшной задачей. Настоящий ад жил в постобработке: выровнять развороты, отделить страницы, вытащить полезную область, поправить перспективу, убрать дефекты и не срезать то, что для читателя выглядит как пыль, а для текста на урду может оказаться значимым символом. В корпусе были не только печатные издания, но и старые литографии, рукописные заметки и экземпляры с полями, исписанными комментариями. Для урду, особенно в письме Nastaliq, это отдельный уровень сложности: много мелких элементов, диакритики, точек, вариативная верстка и очень плохая совместимость с шаблонным компьютерным зрением в духе «один пайплайн на все».

К 2026 году ручной режим начал буквально разваливаться на железе. Один Nikon D5300 дошел до 576 тысяч срабатываний, второй D3300 — до 326 тысяч. Несмотря на такой марафон, после остановки проекта в апреле 2026-го у команды оставалось более 526 тысяч двухстраничных снимков, которые еще нужно было привести в архивный вид. Вручную это уже не выглядело задачей даже для очень мотивированных людей. И вот тут история про культурное сохранение неожиданно превращается в историю про нормальный инженерный ресерч без корпоративного пафоса.

Один из участников попытался автоматизировать процесс через OpenCV, но быстро уперся в типичную проблему rule-based-подходов: то, что работает на одной пачке книг, ломается на следующей. Толщина блока меняется, тень в корешке ведет себя иначе, поля «плавают», а соседние элементы текста мешают распознаванию границ. Тогда команда использовала собственный ручной труд как обучающую выборку. Идея была на удивление здравая: взять уже обработанные в Photoshop страницы как целевые метки, вычислить соответствия между исходниками и финальным результатом, а затем обучить модель на этой паре «как снято» и «как должно быть после редактора».

Дальше началась не магия ИИ, а скучная и очень полезная инженерия. Нужно было точно попадать в границы кропа, хотя плотный текст на урду постоянно повторяет штрихи, слова и рамки, из-за чего алгоритм легко цепляется не за ту страницу. Отдельной задачей стало определение видимой области и разделение разворота в районе корешка, где мешают глубокие тени и таблицы. Ошибки обрезки пришлось лечить отдельным проходом, дефекты и загрязнения — еще одним. Самое интересное наблюдение: увеличение модели и добавление большего числа тренировочных примеров не улучшало результат, а ухудшало его. Причина почти анекдотическая, но понятная любому, кто работал с грязными данными: отступы и правила кропа выбирались под каждую книгу вручную, по редакторскому суждению, и общего шаблона там просто не было. Чем больше разнородных книг попадало в обучение, тем хуже модель угадывала локальные решения.

В финале команда пришла не к универсальному «архивному GPT для всего наследия человечества», а к куда более взрослому результату. Для новой книги системе все еще нужны десять калибровочных кропов, после чего ее можно прогонять целиком. Для бизнеса это, возможно, звучит недостаточно масштабно. Для реальной оцифровки редких книг — наоборот, звучит как редкий случай, когда автоматизация уважает предметную область, а не притворяется, что все книги одинаковы. Здесь нет истории про замену человека моделью. Есть история про то, как человек перестает тратить недели на механическое выравнивание и начинает заниматься тем, где без него пока никак.

На этом фоне особенно заметен контраст с другой линией рынка, о которой Tom's Hardware тоже напоминает: крупные AI-компании сканируют редкие книги и физически уничтожают экземпляры ради обучения моделей. Пакистанский проект двигался в прямо противоположной логике. Книги не разбирали на куски, не превращали в одноразовое сырье, не оправдывали процесс абстрактным «прогрессом». Люди просто пытались сохранить язык и письменную культуру, а по дороге собрали ML-процесс, который может пригодиться похожим инициативам по всему миру. Для русскоязычной IT-аудитории здесь урок довольно приземленный: лучшие прикладные пайплайны часто появляются там, где есть узкая задача, ручная экспертиза и накопленный массив правок, а не там, где кто-то в очередной раз обещает «автоматизировать контент целиком».

Техническая часть проекта тоже выглядит на удивление взрослой для инициативы «на энтузиазме». Архив хранится в пуле ZFS, а целостность контролируется через манифесты BLAKE3. То есть авторы думали не только о том, как снять и выровнять страницы, но и о том, как потом не потерять результат. И это, пожалуй, главный вывод из всей истории. Оцифровка редких книг в 2026 году — это уже не просто фотоаппарат над столом. Это смесь компьютерного зрения, ручной разметки, хранения, контроля целостности и очень трезвого понимания границ автоматизации. Вопрос теперь не в том, сможет ли ИИ «заменить архивиста», а в том, сколько еще таких нишевых, почти невидимых проектов уже накопили данные и опыт, из которых вырастут самые полезные инструменты следующего цикла.

Поделиться: Telegram X LinkedIn