Более 600 обугленных папирусов из Геркуланума могут получить более короткий путь к расшифровке: исследователи показали, что даже ручной XRF-сканер способен отобрать самые перспективные свитки Геркуланума для дальнейшего анализа. Для IT-аудитории здесь важен не романтический образ древней библиотеки, а рабочий пайплайн: дешёвый предварительный скрининг, затем дорогая томография, цифровое разворачивание и машинное обучение.
Команда исследователей создала современные модельные папирусы, обуглила их по аналогии с древними образцами и проверила, можно ли заранее определить, где чернила содержат свинец, сообщает Ars Technica. Работа опубликована в PLoS ONE; один из авторов проекта — Дуглас Сайлер, бывший изобретатель, который заинтересовался проблемой после знакомства с попытками прочитать Геркуланумские папирусы через компьютерную томографию и ИИ.
Проблема старая и неприятная: папирусы из виллы в Геркулануме пережили извержение Везувия 79 года н. э., но превратились в хрупкие углеродные рулоны. Физически раскрывать их нельзя — слишком велик шанс потерять текст вместе с материалом. Поэтому последние годы вокруг них строят стек технологий: микрокомпьютерная томография, сегментация слоёв, виртуальное разворачивание, нейросети для поиска слабого сигнала чернил на фоне папируса. Звучит как задача из компьютерного зрения, только датасету две тысячи лет, а разметка стоит неприлично дорого.
Слабое место такого подхода — контраст. Если текст написан углеродными чернилами на углеродизированном папирусе, рентгеновское изображение почти не даёт разницы между буквами и фоном. Лаборатория Брента Сирлза из Университета Кентукки уже много лет работает с виртуальным разворачиванием подобных объектов: в 2016 году его команда смогла прочитать фрагменты свитка Эйн-Геди, найденного в синагоге, уничтоженной пожаром примерно в VI веке. Но Геркуланумские папирусы сложнее: здесь часто приходится вытаскивать не яркий сигнал, а почти текстурный намёк.
Новая идея выглядит практично: искать не все свитки подряд, а те, где чернила могли содержать свинец. В 2016 году исследователи уже находили буквы со следами свинца в двух фрагментах одного свитка. Если таких образцов больше, они должны гораздо лучше проявляться при рентгеновском сканировании. Сайлер собрал междисциплинарную команду, куда вошли химики из Беркли, специалист по древнеегипетским чернилам и физики из NIST. Да, иногда нормальная архитектура проекта — это не очередной фреймворк, а люди, которые умеют говорить друг с другом через границы дисциплин.
Для проверки гипотезы авторы купили современный египетский папирус, приготовленный по технологии, близкой к древней, и традиционные чернила на основе сажи. Затем в чернила добавили разные концентрации нитрата свинца. Старшеклассники нанесли на папирусы тексты тростниковым стилом: среди источников были Библия, «Звёздные войны» и телесериал The Outer Limits. После этого образцы просканировали, обуглили в высокотемпературной печи и сделали трёхмерные рентгеновские снимки в Центре нейтронных исследований NIST в Мэриленде.
Результат оказался ровно тем, чего не хватало проектам вроде Vesuvius Challenge: буквы со свинцом на снимках проявлялись резко и понятно. Соавтор исследования Майкл Сайрус Догерти из NIST адаптировал программу, которую раньше писал для разворачивания CT-сканов «jelly roll» — внутренних рулонных структур литий-ионных батарей. Пример хороший: алгоритмические инструменты из промышленной диагностики внезапно оказываются полезны для античной филологии. Не потому что «ИИ всё умеет», а потому что разные области делят одну и ту же геометрию данных.
Vesuvius Challenge уже доказал, что связка открытых соревнований, томографии и ML может двигать задачу. Первую награду за расшифровку букв проект выдал в 2023 году, а в 2024-м присудил главный приз в $700 000 за получение первого читаемого текста. Позже удалось получить рентгеновское изображение внутренней структуры свитка PHerc. 172 из Бодлианской библиотеки Оксфорда, а в 2026 году свиток PHerc. 1667 был прочитан полностью и оказался философским трактатом об этике и моральном прогрессе человека.
Практическая ценность новой работы — в приоритизации. Сканировать каждый древний рулон на максимальных настройках, строить сложные 3D-модели и гонять ML-пайплайн дорого и медленно. Если ручной XRF-сканер может показать, где есть свинец, исследователи получают простой фильтр: эти образцы идут в первую очередь, остальные ждут более тонких методов. Для разработчиков и продактов это знакомая логика: сначала дешёвый сигнал, потом тяжёлая обработка, а не наоборот.
Для рынка ИИ это не история про очередную модель, которая «почти рассуждает». Это более взрослый сценарий: ИИ работает только там, где ему подготовили физику измерения, нормальный входной сигнал и понятный критерий отбора данных. Свитки Геркуланума в этом смысле напоминают корпоративные архивы: можно купить мощный инструмент анализа, но если исходные данные плохо сняты, загрязнены или не отсортированы, магии не будет. Следующий вопрос — сколько древних текстов окажутся написаны чернилами со свинцом и насколько быстро такой скрининг встроят в рабочий процесс Vesuvius Challenge; детали исходной публикации приводит .