AI И НЕЙРОСЕТИ

OpenAI заплатит за биоданные из обанкротившихся стартапов

$500 тыс. получит проект по сбору данных биотех-банкротов: OpenAI Foundation ищет топливо для медицинских AI-моделей.

✍️ Редакция iTech News | 16.09.2026 | ⏱ 5 мин | Источник: MIT Technology Review
🧬

OpenAI Foundation выделит $500 тыс. на сбор документов обанкротившихся биотех-компаний: регуляторных файлов, данных по безопасности, производственных стратегий и другой информации, которая обычно остаётся коммерческой тайной. Это новый заход на данные для AI в медицине: без них модели плохо понимают реальную, грязную и дорогую кухню разработки лекарств.

Грант стал частью программы Public Data for Health, сообщает MIT Technology Review. Идею предложила Руксандра Тесло, аналитик в области клинических испытаний: покупать или получать массивы данных компаний, которые проходят банкротство, и превращать их в «потерянный архив» биотеха. Работать над проектом будет 1Day Sooner, организация, представляющая интересы добровольцев клинических исследований; Тесло её консультирует.

Логика проста и неприятна для индустрии: в биотехе провалы часто хоронят вместе с ценными знаниями. Стартап может не довести препарат до рынка, но оставить после себя переписку с регуляторами, результаты испытаний, производственные гипотезы, токсикологию, измерения по эффективности и безопасности. Для людей это архив неудач. Для AI-моделей — учебник о том, где именно ломается разработка лекарств.

OpenAI Foundation в первом раунде медицинских грантов объявила и о более крупных ставках. $40 млн пойдут на программу Университета Северной Каролины в Чапел-Хилле по сбору данных о новых противораковых вакцинах. Также фонд поддержит OpenAdmet — группу, которая проводит соревнования по прогнозированию эффектов лекарств. На этом фоне $500 тыс. для архива банкротств выглядят скромно, но идея может оказаться более заразительной: покупать данные на конкурсах кредиторов иногда дешевле, чем годами строить консорциум с нуля.

Президент и сооснователь 1Day Sooner Джош Моррисон считает, что неэксклюзивные копии отдельных корпоративных датасетов можно получать за «несколько десятков тысяч долларов». Сейчас у организации уже есть три набора данных; два из них передала Lumen Bioscience. Ещё две попытки получить файлы фармкомпаний в этом году не удались: заявки 1Day Sooner не приняли. То есть это пока не конвейер, а проверка, можно ли вообще вытаскивать такие активы из процедур банкротства без юридического и репутационного пожара.

Пожар вполне возможен. Банкротства уже начинают выглядеть как новая охота за данными для AI. В августе Google выиграла заявку на получение корпоративных данных обанкротившейся авиакомпании Spirit Airlines, включая около 100 млн писем. Это вызвало возражения со стороны бортпроводников и других сотрудников: люди опасались, что частная или служебная информация окажется слишком широко доступной. В биотехе ставки ещё выше: речь идёт не только о коммерческих секретах, но и о медицинских данных, регуляторных документах и потенциально чувствительной информации о пациентах.

В центре проекта — common technical documents, стандартные досье, которые компании готовят для регуляторов. В них может быть вся история препарата: научные обоснования, клинические измерения, вопросы надзорных органов, ответы компании, детали производства и безопасности. По мысли Тесло, если накопить достаточно таких файлов, AI можно обучить не просто генерировать красивые молекулы, а помогать проходить регуляторный лабиринт. Для маленьких биотех-компаний это особенно важно: инновации часто рождаются у них, а денег и опыта для клинической разработки не хватает.

Здесь полезно отрезвиться. Популярная формула «AI вылечит рак» звучит эффектно, но реальная разработка лекарств упирается не только в поиск молекулы. Тесло указывает, что около 70% времени и денег в drug development уходит на клиническую разработку: организацию испытаний, тестирование препарата, работу с регуляторами. Это не романтическая лаборатория из презентаций, а таблицы, протоколы, исключения, поправки и месяцы ожидания. Именно поэтому данные для AI из неудачных проектов могут быть ценнее очередного синтетического бенчмарка.

Для OpenAI Foundation это ещё и тест собственной новой роли. OpenAI начиналась как некоммерческая организация, затем Сэм Альтман перестроил её вокруг коммерческой компании, которая выпускает модели и продукты. По данным источника, фонд владеет 26% OpenAI и при возможной оценке компании в $1 трлн может держать долю примерно на $250 млрд. Для сравнения: Gates Foundation и связанный с ним траст на конец 2025 года имели около $180 млрд. Деньги такого масштаба легко объявить миссией; гораздо сложнее потратить их так, чтобы результат не свёлся к дорогим пресс-релизам.

Фонд уже разгоняет грантовую программу. В августе крупнейший на тот момент грант — $100 млн — получила Common Health Coalition, организация, которая помогает пациентам получать доступ к препаратам от гепатита C. Исполнительный представитель фонда Джейкоб Трефетен говорит, что OpenAI Foundation работает в основном отдельно от OpenAI, но разделяет миссию сделать так, чтобы искусственный интеллект приносил пользу человечеству. По его словам, фонд хочет выдать $1 млрд грантов до конца года.

Парадокс в том, что медицинские гранты объявляются на фоне совсем другого разговора об AI: рисков биологического оружия, ускорения возможностей моделей и сценариев выхода систем из-под контроля. На прошлой неделе Альтман и Илон Маск поддержали призыв главы Anthropic Дарио Амодеи замедлить рост возможностей AI-моделей, чтобы меры защиты успевали за прогрессом. Получается нервная конструкция: одни и те же технологии должны помогать лечить болезни и одновременно не становиться инструкцией по созданию новых угроз.

Для разработчиков, продактов и IT-директоров здесь главный сигнал не про биологию, а про рынок данных. Модели общего назначения всё чаще упираются не в архитектуру, а в доступ к редким, дорогим и плохо оцифрованным доменным массивам. В медицине это регуляторные файлы и клинические данные; в промышленности — журналы отказов и производственные режимы; в финтехе — исторические решения комплаенса. Побеждать будут не только команды с сильными моделями, но и те, кто умеет легально добывать, чистить, описывать и лицензировать такие архивы.

Вопрос теперь не в том, нужны ли данные для AI, а в том, кто установит правила их добычи. Если банкротства станут стандартным каналом покупки корпоративной памяти, индустрии придётся быстро договориться о границах: где общественная польза, где коммерческий интерес, где приватность, а где просто удобный способ обучить модель на чужих ошибках.

Поделиться: Telegram X LinkedIn