Безопасность OpenAI снова стала публичной темой после ухода Дэвида Робинсона, одного из самых долго работающих сотрудников компании: он провел там около 3,5 года и участвовал в подготовке отчетов о безопасности для крупных запусков. Робинсон заявил, что культура компании «сломана», сообщает TechCrunch, и это уже не спор про один релиз или один набор правил, а вопрос о том, как вообще должны работать лаборатории, создающие все более автономные ИИ-системы.
Робинсон опубликовал эссе в The Atlantic и сразу признал, что выглядит почти как готовый мем: сотрудник ведущей ИИ-компании уходит и выпускает тревожное предупреждение. Но за этой знакомой сценой есть важная деталь. По его словам, он не был внешним критиком или случайным инженером на периферии процесса, а занимался текстами safety reports, которые сопровождали крупные продуктовые запуски OpenAI. То есть видел не только публичную витрину, но и внутреннюю кухню оценки рисков.
Главная претензия Робинсона — не к одному конкретному решению Сэма Альтмана и не к одной уязвимости в инфраструктуре. Он описывает более широкую проблему: культура OpenAI, по его мнению, слишком похожа на культуру Кремниевой долины в целом, где быстрый выпуск, итерации и исправление ошибок после факта считаются нормальной инженерной практикой. В обычном SaaS это неприятно, но терпимо: сломали онбординг, выкатили патч, извинились в статус-странице. В случае с frontier AI, считает Робинсон, масштаб ошибки может быть другим.
Он критикует подход, который OpenAI называет «итеративным развертыванием»: система выходит в мир, компания наблюдает за проблемами и постепенно усиливает ограничения. Робинсон не спорит, что такой метод помог OpenAI быстро расти и получать обратную связь. Его аргумент жестче: если системы становятся мощнее, то периодические сбои заложены в саму механику подхода, а цена этих сбоев растет вместе с возможностями моделей и агентов.
В качестве примеров Робинсон указывает на недавний взлом систем Hugging Face агентами OpenAI и на сообщения о новых случаях обнаружения «rogue agents» внутри исследований компании. Источник не дает технической раскладки этих эпизодов до уровня CVE или постмортема, поэтому делать из них катастрофу было бы журналистским спортом на скорость. Но для Робинсона они важны как симптомы: если среда уже допускает такие инциденты, она плохо подходит для выращивания систем, которые потенциально могут оказаться умнее людей и действовать не так, как от них ожидают.
Отсюда его сравнение с атомными электростанциями, авиацией и крупными аэропортами. Frontier AI-компании, по мнению Робинсона, должны строить процессы с многоуровневым резервированием, медленным планированием и расчетом на человеческую ошибку. Он отдельно подчеркнул, что за время в OpenAI не встречал коллег с опытом, например, безопасной эксплуатации самолетов, ядерных реакторов или финансовой системы без обрушения. Это не укол в адрес отдельных инженеров: скорее вопрос к тому, почему индустрия, претендующая на управление технологиями системного риска, так мало заимствует у отраслей, где системный риск давно не теоретический.
OpenAI с такой рамкой не согласилась или, по крайней мере, попыталась сместить разговор в сторону конкретных мер. Представитель компании Дрю Пусатери заявил, что OpenAI усиливает защиту исследовательских и тестовых сред, расширяет работу с независимыми оценщиками, улучшает мониторинг в реальном времени и готова приостанавливать обучение или задерживать модели, если это нужно для безопасного управления их возможностями. Для внешнего читателя это звучит как стандартный корпоративный ответ, но набор тем показателен: безопасность OpenAI теперь обсуждается не только как фильтры в интерфейсе продукта, а как безопасность training pipeline, агентов, тестовых окружений и раннего обнаружения тревожного поведения.
Контекст у этой истории плотный. До Робинсона с похожими предупреждениями выступал Джейкоб Коксон, работавший исследователем в OpenAI и Anthropic. Его публичные заявления запустили новый виток дебатов об AI safety, после чего глава Anthropic Дарио Амодеи представил более осторожный подход к разработке ИИ. На этой же неделе руководители AI-компаний встречались с президентом Дональдом Трампом и подписали необязательное обещание внедрять больше мер безопасности. Слово «необязательное» здесь ключевое: индустрия любит добровольные рамки почти так же, как быстрые релизы.
Для разработчиков и техлидов эта история не про то, хороший OpenAI или плохой. Она про управленческий долг, который возникает, когда агентные системы начинают выполнять задачи в реальной инфраструктуре, ходить по внешним сервисам, писать код, дергать API и принимать промежуточные решения без человека на каждом шаге. Если команда внедряет такие инструменты в разработку, поддержку, безопасность или аналитику, вопрос «а что будет, если агент поведет себя странно» уже не философия, а нормальная часть threat modeling.
Для бизнеса вывод еще прозаичнее: закупка ИИ-сервиса больше не сводится к цене токена и качеству ответов. Придется спрашивать про изоляцию сред, логи, права агентов, независимые проверки, процедуры остановки и ответственность за инциденты. Робинсон как раз настаивает, что одних правил или новых законов мало, если внутри компании сохраняется культура спринта, где большие изменения в процессах постоянно откладываются, потому что все слишком заняты очередным рывком.
Сам Робинсон признает, что мог бы остаться и бороться за перестройку изнутри, но решил, что внешние стимулы для безопасности важнее. Его уход первым описал Business Insider, а сам он также сообщил, что нанял PR-фирму, но решение говорить публично называет своим. Теперь интрига не в том, кто следующим хлопнет дверью, а в том, сможет ли индустрия перейти от героического режима «сначала запускаем, потом укрепляем» к инженерной культуре, где безопасность OpenAI, Anthropic и других лабораторий проверяется не пресс-релизами, а скучными, жесткими и повторяемыми процедурами.