ИИ в фарме пока упирается не столько в архитектуру моделей, сколько в дефицит качественных данных и медленный лабораторный цикл. К такому выводу пришел MIT Technology Review в партнерском материале с Cytiva: алгоритмы уже умеют предлагать больше кандидатов, но проверить их быстро и корректно отрасль по-прежнему не может.
Для рынка это неприятная, но полезная развилка. Если раньше главным обещанием AI-дизайна было ускорение поиска молекул, то теперь выясняется более прозаичная вещь: без хороших данных и автоматизации лабораторий даже сильная модель остается дорогим генератором гипотез.
Цена ошибки в фарме остается запредельной
MIT Technology Review напоминает базовые цифры отрасли: вывод нового препарата на рынок обычно занимает 10–15 лет, стоит около $1-2,5 млрд, а доля неудач по дороге к одобрению превышает 90%. На этом фоне интерес к ИИ выглядит не модой, а попыткой сократить очень дорогой перебор.
Издание также ссылается на так называемый закон Eroom: с 1950-х стоимость разработки новых лекарств примерно удваивалась каждые девять лет. Для фармы это означает простую экономику: кто раньше находит рабочий кандидат и быстрее доводит его до клиники, тот выигрывает не только научно, но и коммерчески.
Лаборатории не успевают за скоростью моделей
По словам Пола Белчера из Cytiva, заметный сдвиг уже произошел на раннем этапе поиска соединений. Если раньше компании в основном проверяли большие библиотеки готовых молекул на связывание с биологической мишенью, то теперь часть игроков пытается сразу проектировать новые кандидаты с помощью ИИ.
Но здесь и возникает узкое место. Модель может предложить больше вариантов, однако каждый такой кандидат все равно нужно подтвердить экспериментом. Более того, ИИ пока не умеет достаточно надежно предсказывать свойства, которые критичны для дальнейшей разработки, включая кинетику связывания и пригодность соединения к развитию в полноценный препарат.
Итог для отрасли довольно земной: цифровая часть воронки ускорилась, а «мокрая» лаборатория снизу часто не поспевает. Чем больше перспективных молекул генерирует система, тем выше нагрузка на команды, которые должны их тестировать, очищать и описывать.
Проблема не только в объеме, но и в качестве данных
Вторая проблема глубже. Многие ранние модели в разработке лекарств обучались на одних и тех же публичных наборах данных, поэтому отрасль начинает упираться в «стену данных»: новые итерации дают все меньше преимущества, потому что исходный материал у всех похожий.
Проблема еще и в том, что такие наборы часто создавались не под машинное обучение. В них не хватает структуры, разметки и разнообразия, а публикационный перекос искажает картину: успешные эксперименты чаще попадают в открытый доступ, неудачные остаются внутри лабораторий. Для модели это плохая школа: она лучше учится распознавать признаки успеха, чем причины провала.
MIT Technology Review также напоминает об отдельном риске для биомедицины: качестве самих научных данных. Издание ссылается на оценку микробиолога Элизабет Бик, которая еще в 2016 году обнаружила проблемные изображения почти в 4% проверенных биомедицинских статей. На этом фоне Cytiva продвигает свой Image Integrity Checker, который использует криптографические хэши для проверки целостности научных изображений.
Ставка смещается с моделей на инфраструктуру
Следующий логичный шаг для отрасли — замкнутый цикл между моделью и экспериментом. Идея проста: алгоритм предлагает кандидата, роботизированная лаборатория быстро проводит тест, результаты возвращаются в систему, и следующая итерация стартует уже на свежих данных.
Но такой сценарий требует не только сильных моделей. Нужны совместимые приборы, нормальный обмен данными и инфраструктура, которая выдает FAIR-данные — то есть данные, которые можно находить, использовать, объединять и переиспользовать. Пока же многие лабораторные системы живут как закрытые острова, а это быстро превращает разговор об автоматизации в обычную зависимость от одного поставщика.
Значение для рынка
Для русскоязычной ИТ-аудитории вывод практический: в фарме конкуренция смещается от красивых заявлений про генеративный ИИ к более скучной, но решающей работе с данными, приборами и интеграцией. Это сигнал не только для биотех-стартапов, но и для поставщиков инфраструктуры, разработчиков лабораторного ПО и команд, которые строят платформы для R&D: ценность будет у тех, кто умеет замкнуть контур между алгоритмом и экспериментом, а не просто показать очередную модель на слайде.
Именно поэтому гонку, скорее всего, выиграет не тот, кто первым сгенерирует красивую молекулу, а тот, кто первым соберет устойчивый цикл проверки и дообучения без потери качества данных.