Из 302 предложенных ИИ последовательностей 285 удалось синтезировать, и 16 из них подавили рост E. coli. Это уже не демонстрация красивых строк из A, T, C и G: геномные модели показали, что могут проектировать рабочие варианты вирусов, пусть пока и рядом с хорошо изученным образцом. Для разработчиков ИИ-инструментов и команд, работающих с биоданными, сигнал предельно практичный: вопрос теперь не в том, умеет ли модель писать ДНК, а в том, кто и как будет ограничивать ее применение.
Как пишет Ars Technica, группа исследователей из Стэнфорда проверила, можно ли использовать модели Evo 1 и Evo 2 не для проектирования отдельных белков, а для сборки целого вирусного генома. В качестве стенда выбрали бактериофаг PhiX174, заражающий E. coli: у него 11 генов примерно на 5400 нуклеотидов, функции всех этих генов известны, а цикл инфекции разложен почти по шагам. Для такой работы это почти идеальный объект: достаточно простой, чтобы быстро отсеивать провалы, и достаточно изученный, чтобы отличать реальное новшество от банального копирования эталона.
Основная часть ИИ в биологии до сих пор крутилась вокруг белков, и логика тут железная. Белки делают почти всю полезную работу в клетке, поэтому новый белок часто означает новую функцию, новый катализатор или новый способ вмешаться в биохимию. С геномами история сложнее. Между ДНК и готовым белком есть кодовый слой, регуляция, структура генов, и долго было неочевидно, сможет ли модель, обученная на последовательностях из четырех букв, выдать что-то биологически осмысленное, а не просто статистически правдоподобное. Предыдущие версии Evo уже показывали, что могут генерировать ДНК, кодирующую рабочие бактериальные белки, и даже имитировать архитектуру генов сложных клеток. На этом фоне переход к целому вирусному геному выглядит не красивой демонстрацией, а следующим логичным тестом.
Но именно на этом месте исследователи резко притормозили с романтикой про безграничные возможности. В обучение сознательно не включали вирусы, заражающие сложные организмы: даже если мы пока не понимаем, что именно модель сгенерировала, это не тот класс сюрпризов, который хочется проверять в лаборатории. Вместо этого Evo 1 и Evo 2 докормили более чем 2 млн нуклеотидов бактериофагов и отдельно донастроили на семействе Microviridae, куда входит PhiX174. Идея была простой: оставить задачу в безопасной зоне, но при этом проверить, может ли модель удержать целостность сразу всего вирусного генома, а не только отдельных генов.
Дальше началась уже не магия, а нормальная инженерная возня с промптом. Слишком длинная подсказка заставляла модель почти дословно дописывать исходный геном; слишком короткая уводила ее в биологический сюрреализм. Лучший результат дали затравки длиной 4-9 нуклеотидов. После генерации исследователи жестко чистили выдачу: отбрасывали варианты с поврежденным белком прикрепления, с длинными повторами одной и той же буквы, с нетипичным соотношением GC и AT и с явными отклонениями по длине. Для ключевого белка порог сходства поставили на уровне не ниже 60% к исходному варианту. После такого фильтра осталось 302 кандидатных генома; 285 из них удалось химически синтезировать и ввести в бактерии.
В большинстве случаев бактерии вообще не впечатлились. Но 16 последовательностей все же подавили рост E. coli, то есть оказались жизнеспособными вирусами. Девять были рабочими уже в том виде, в котором их выдала модель, еще семь добрали функциональность после дополнительных мутаций в бактериальной среде. Общая доля успеха получилась скромной, 5,6%, и это важная цифра против разговоров о том, что ИИ уже свободно собирает вирусы. Зато если смотреть только на варианты, похожие на исходный PhiX174 хотя бы на 98%, доля жизнеспособных подскакивала до 46%. Ни один рабочий вариант не тронул участок, где запускается репликация генома. Это совпадает с тем, что о PhiX174 и так известно: по прошлым работам даже одна аминокислотная замена в одном из вирусных белков нередко ломает систему целиком. И все же среди удачных образцов были нетривиальные ходы: один вирус потерял один из белков и компенсировал это перестройкой в других местах генома, другой получил новый ген, а еще один заменил собственный ген на версию от очень далекого родственника.
Для разработчиков и руководителей ИИ-направлений главное здесь не сам бактериофаг, который человеку не опасен, а новая связка модели и лаборатории. Геномные модели перестают быть инструментом в стиле «посмотреть, что получится», и становятся частью полноценного цикла проектирования: модель предлагает последовательность, лаборатория быстро проверяет ее, удачные варианты идут в следующую итерацию. В софте это напоминало бы момент, когда автодополнение внезапно получило доступ не только к IDE, но и к продакшену. Авторы работы прямо предупреждают: готовиться к сценарию, где похожие системы начнут проектировать вирусы для позвоночных, лучше заранее. Для бизнеса и исследовательских центров вывод неприятно прагматичный: одних фильтров на уровне датасета мало, нужны ограничения доступа, аудит промптов, контроль на этапе синтеза ДНК и понятная зона ответственности между ML-командами и специалистами по биобезопасности.
Пока эта история выглядит как узкая демонстрация на одном хорошо изученном фаге, да и большинство удачных вариантов по-прежнему держатся близко к оригиналу. Но именно так обычно и меняется технологический риск: сначала система умеет работать только в узком коридоре, потом коридор расширяется быстрее, чем успевают обновиться правила. Следующий спор вокруг ИИ в биологии будет уже не о том, может ли модель написать осмысленный кусок ДНК, а о том, кто именно получит право превращать такие последовательности в реальные объекты.