Исследователь Anthropic Джейкоб Коксон ушел из компании и публично обвинил Anthropic и OpenAI в гонке к самосовершенствующемуся суперинтеллекту. Для рынка это не очередная страшилка про безопасность ИИ из внешнего экспертного клуба: вслед за ним похожие опасения озвучили два действующих сотрудника Anthropic, сообщает The New Stack. Для разработчиков, CTO и продуктовых команд это неприятное напоминание: разговор об AI-risk уже не где-то на конференциях, а внутри лабораторий, которые делают модели для ваших IDE, саппорта, аналитики и внутренних агентов.
Коксон объявил об уходе вечером 8 сентября в X. По его словам, последние три года он занимался pretraining-исследованиями в OpenAI и Anthropic. Это не отдел «этики на слайдах», а слой, где формируются базовые способности модели до пользовательской доводки, RLHF и корпоративных ограничителей. Именно поэтому его заявление прозвучало громче обычного поста уволившегося сотрудника: человек работал близко к ядру технологий, которые потом превращаются в ассистентов, кодовых агентов и API.
Главная претензия Коксона проста и жесткая: ведущие лаборатории, по его оценке, движутся к системам, способным улучшать самих себя, быстрее, чем научились надежно удерживать такие системы в человеческих целях и ограничениях. Он утверждает, что многие люди, создающие frontier-модели, всерьез допускают катастрофический сценарий уже до конца десятилетия. Это не доказательство будущей катастрофы, но важный сигнал о настроениях внутри индустрии: если инженеры, которые знают стек изнутри, говорят не только о бенчмарках и latency, бизнесу стоит слушать внимательнее.
Ситуацию усилил ответ Эвана Хьюбингера, руководителя направления Alignment Science в Anthropic. Он публично согласился с центральной тревогой Коксона и написал, что лично оценивает риск гибели людей от ИИ в ближайшее десятилетие выше 10%. При этом Хьюбингер уточнил важную деталь: нынешние модели он не считает главным источником немедленного риска. Его беспокоит сценарий, в котором суперинтеллект появляется через рекурсивное самосовершенствование, а задача выравнивания целей такой системы с человеческими интересами остается нерешенной.
Еще один сотрудник Anthropic, Самуэль Маркс, работающий в направлении scalable oversight, тоже высказался в личном качестве. Его тезис менее кинематографичный, но для инженеров даже более полезный: продвинутые ИИ-системы нельзя просто «запрограммировать вести себя хорошо» так же, как обычный сервис с понятной спецификацией. Модели обучаются на статистических закономерностях, демонстрируют неожиданные стратегии и иногда ведут себя не так, как предполагали разработчики теста. Для тех, кто уже внедряет агентов в CI/CD, обработку тикетов или операции с данными, это звучит как предупреждение о классе багов, который не ловится только unit-тестами и красивой политикой доступа.
Контекст тоже важен. Anthropic годами строила публичный образ компании, которая относится к безопасности ИИ серьезнее конкурентов: конституционное обучение, исследования интерпретируемости, risk reports, акцент на Claude как более управляемом ассистенте. Поэтому удар пришел не по абстрактной «безответственной Кремниевой долине», а по одному из брендов, который продавал рынку идею осторожного прогресса. OpenAI в этой истории фигурирует как второй центр гонки: Коксон отдельно утверждает, что обе компании слишком сосредоточены на том, кто первым доберется до следующего уровня возможностей.
Для рынка практический вывод не в том, что завтра надо выключить все LLM-интеграции и вернуться к Excel-макросам. Вывод трезвее: автономность становится главным параметром риска. Чат-бот, который пишет черновик письма, и агент, который сам запускает код, ходит в интернет, правит репозиторий и дергает внутренние API, живут в разных категориях опасности. Чем ближе система к правам реального сотрудника, тем меньше подходит подход «попробуем в пилоте, потом разберемся». Нужны песочницы, журналирование действий, лимиты полномочий, ручные подтверждения на опасные операции и понятный владелец инцидента.
Для русскоязычных IT-команд эта история особенно приземленная. Большая часть компаний не обучает frontier-модели, зато активно прикручивает чужие API к внутренним процессам: код-ревью, HR-скринингу, продажам, аналитике, DevOps. Если даже сотрудники лаборатории говорят, что задача контроля будущих систем не решена, то на уровне внедрения нельзя делать вид, будто поставщик уже снял все риски. Договор с вендором, DPA и галочка «enterprise» не заменяют threat modeling, оценку данных, контроль доступа и сценарии отключения.
Самый неудобный вопрос теперь не в том, прав ли Коксон в своей оценке конца десятилетия. Вопрос в другом: кто именно получает право решать, какой уровень риска приемлем, когда выгода концентрируется у нескольких AI-лабораторий, а последствия ошибки распределяются на всех пользователей, клиентов и инфраструктуру вокруг них. Пока индустрия отвечает на это скоростью релизов, инженерам на местах придется быть скучными взрослыми: ограничивать агентов, проверять их действия и не путать впечатляющую демонстрацию с управляемой системой.