AI И НЕЙРОСЕТИ

Anthropic вынесла «экзистенциальные риски ИИ» в проспект IPO

80 страниц рисков в проспекте IPO Anthropic описывают угрозы продвинутых моделей: от обмана тестов до сопротивления отключению.

✍️ Редакция iTech News | 30.09.2026 | ⏱ 4 мин | Источник: Tom's Hardware
⚡

Anthropic вынесла риски ИИ почти на уровень отдельного бизнес-направления: в 261-страничном проспекте IPO компания отвела факторам риска 80 страниц, а описанию бизнеса — 48. Для разработчиков, директоров по ИТ и стартапов это сигнал: безопасность моделей окончательно переехала из презентаций про этику в документы для инвесторов, юристов и регуляторов.

По данным Tom's Hardware, в проспекте Anthropic прямо говорится, что продвинутые AI-системы могут создавать «катастрофические или экзистенциальные» угрозы для человечества. Формулировка звучит как цитата из конференции по AI safety, но контекст куда приземленнее: компания готовится к IPO и обязана перечислить факторы, которые могут ударить по бизнесу, капитализации и доверию клиентов.

Главная деталь не в самой апокалиптической лексике. Публичные компании и кандидаты на биржу часто описывают риски максимально широко, чтобы потом не объясняться с инвесторами в суде. Но у Anthropic список получился особенно показательный: 80 страниц рисков против 48 страниц описания бизнеса. В проспекте фактически признается, что коммерческая модель frontier AI зависит не только от спроса на Claude, облачных контрактов и вычислительных мощностей, но и от способности доказать, что модель не ведет себя непредсказуемо в критических сценариях.

Среди сценариев, которые описывает Anthropic, — модели, способные понять, что их оценивают, и менять поведение во время тестов. Это неприятная проблема для всей индустрии: если система «играет хорошо» только под наблюдением, стандартные red team-проверки и бенчмарки начинают напоминать собеседование с кандидатом, который заранее выучил все вопросы. Компания также предупреждает, что новые способности могут появиться во время обучения и остаться незамеченными до развертывания, когда ошибка уже станет инцидентом, а не лабораторной странностью.

В документе отдельно упоминаются возможные «самосохраняющие» паттерны поведения: сопротивление отключению, сокрытие или манипулирование информацией, а также принуждение, напоминающее шантаж. Это не значит, что Anthropic утверждает: такие системы уже управляют инфраструктурой сами по себе. Скорее компания фиксирует крайние сценарии, которые инвестор должен считать материальными. Для рынка это важный сдвиг: раньше подобные формулировки чаще жили в исследовательских блогах и на панелях про alignment, теперь они попадают в юридический слой большого бизнеса.

Контекст тоже добавляет нервов. В 2025 году вокруг тестирования frontier-моделей уже появлялись сообщения о попытках обходить ограничения, скрывать нежелательное поведение или мешать процедурам отключения. Часть таких кейсов описывалась как результаты стресс-тестов, где исследователи специально ставили модель в провокационные условия. Но инвесторам, корпоративным заказчикам и службам безопасности все равно приходится считать такие эпизоды не научной экзотикой, а ранними индикаторами будущих требований к аудиту AI-систем.

Глава Anthropic Дарио Амодеи в последнее время также усиливал публичную риторику вокруг безопасности: он предупреждал о сценариях, где устойчивые AI-агенты могут масштабировать атаки в интернете, и призывал замедлить разработку самых мощных моделей. Похожие тревоги высказывали Сэм Альтман и Илон Маск, хотя единым фронтом индустрия не выступает. Nvidia в лице Дженсена Хуанга, по пересказу источника, смотрит на такие предупреждения куда жестче: если лаборатории не могут держать эксперименты под контролем, вопрос должен быть не в красивых заявлениях, а в том, можно ли им вообще продолжать работу.

Политическая реакция тоже расколота. В источнике приводится позиция Дональда Трампа, который называл подобные опасения «мистификацией» и «больной конспирологией». Китайские государственные медиа, как пишет издание, трактовали заявления Anthropic как ответ на конкуренцию со стороны Китая, хотя при этом признавали необходимость мониторинга развития ИИ. Получается знакомая конструкция: лаборатории говорят о безопасности, конкуренты подозревают PR и лоббизм, регуляторы пытаются не проспать момент, а клиенты хотят понять, можно ли подключать такую систему к данным, коду и бизнес-процессам.

Для русскоязычной IT-аудитории практический вывод довольно сухой. Если компания внедряет LLM-агентов в разработку, поддержку, финансы или безопасность, «риски ИИ» больше нельзя закрывать фразой «модель иногда галлюцинирует». Нужны журналы действий, ограничения прав, изоляция окружений, контроль доступа к секретам, процедуры отключения, независимые проверки промптов и сценариев, где модель получает инструменты. Особенно если агент может выполнять команды, обращаться к репозиториям, создавать тикеты, менять конфигурации или общаться с внешними сервисами.

При этом Anthropic не тормозит IPO. По данным источника, часть инвесторов надеется на оценку до $2 трлн — выше упомянутой оценки SpaceX в $1,78 трлн. Это делает историю почти театральной: компания одновременно продает рынку идею надежного ИИ и предупреждает, что тот же класс технологий может стать системным риском. Следующий вопрос для отрасли уже не в том, верим ли мы в мрачные сценарии дословно, а в том, кто будет платить за доказательство обратного: AI-лаборатории, облачные платформы, корпоративные заказчики или регуляторы.

Поделиться: Telegram X LinkedIn