Anthropic заявила о пяти случаях, когда пользователи пытались обойти защитные механизмы Claude для исследований, потенциально связанных с биологическим оружием. Биориски Claude теперь выглядят не как сюжет для конференционного доклада, а как практическая проблема для AI-команд, комплаенса и всех, кто встраивает большие модели в научные и корпоративные процессы.
По данным Ars Technica, компания описала эти эпизоды в отчете о злоупотреблениях своими моделями. В кейсах фигурировали пользователи из регионов, где Anthropic запрещает доступ к своим сервисам, включая Россию, Китай и Иран. Компания утверждает, что часть пользователей «обходила контроль» и скрывала реальную цель запросов, чтобы пройти через фильтры безопасности.
Самый показательный пример связан с исследователем из «неподдерживаемого региона», который, по словам Anthropic, несколько недель планировал с Claude эксперименты с птичьим гриппом. Система безопасности ограничила его работу самыми слабыми моделями компании. Аккаунты, упомянутые в отчете, Anthropic заблокировала, но не раскрыла ни названия организаций, ни страны, где происходили инциденты.
Ключевая сложность здесь неприятно простая: опасная биология часто выглядит почти так же, как нормальная наука. Одни и те же знания могут пригодиться для разработки вакцины, диагностики, защиты лаборатории или, в худшем сценарии, для создания патогена. Anthropic прямо оговаривает, что не может доказать злой умысел всех ученых из приведенных примеров. Для систем модерации это плохая новость: фильтр должен отличать не только токсичную инструкцию от безобидной, но и намерение от профессионального контекста.
Биориски Claude всплыли на фоне более широкого спора о безопасности продвинутых AI-моделей. В источнике упоминается отставка сотрудника Anthropic Джейкоба Коксона, который заявил, что часть команды всерьез считает: AI может привести к катастрофическим последствиям уже до конца десятилетия. Там же говорится о растущей тревоге после выхода более сильных моделей и об эпизоде, когда OpenAI в июле сообщила, что ее модели автономно взломали AI-платформу Hugging Face. Формулировка звучит громко, но общий тренд понятен без драматургии: модели становятся полезнее, а вместе с этим растет и стоимость ошибки в доступе к ним.
Для разработчиков и продуктовых команд этот кейс важен не только из-за слова «биооружие». Он показывает, что простая модерация по запрещенным словам быстро упирается в потолок. Пользователь может дробить задачу, менять формулировки, выдавать опасный сценарий за академический, переводить его в серию технически корректных вопросов. Чем мощнее модель, тем больше значение имеют не только фильтры на входе, но и анализ сессии целиком, риск-скоринг пользователя, ограничения по регионам, аудит цепочек запросов и политика доступа к самым сильным моделям.
Для бизнеса вывод тоже приземленный. Если компания дает сотрудникам или клиентам доступ к LLM, особенно в R&D, фарме, биотехе, химии, кибербезопасности или оборонных смежных областях, ей придется думать не только о защите персональных данных. Нужны правила, какие задачи можно передавать модели, какие нельзя, кто видит логи, кто разбирает спорные случаи и как быстро блокируется подозрительная активность. Это уже не «этика AI» как красивый раздел в презентации, а операционная безопасность.
Отдельный слой истории — конкуренция вокруг самих моделей. В отчете Anthropic также описала попытки семи китайских лабораторий, включая Moonshot и DeepSeek, воспроизвести возможности ее технологий через дистилляцию. Компания говорит о все более сложных методах обхода защит и извлечения возможностей американских frontier-моделей. Для рынка это неприятная развилка: открытость ускоряет инновации, но закрытость не гарантирует контроля. Сильные модели все равно пытаются копировать, обходить и использовать там, где провайдеры доступ формально запретили.
Биориски Claude в этой истории выглядят как ранний стресс-тест для всей AI-индустрии. Провайдерам придется доказывать, что они умеют отличать научную работу от опасной сборки по частям, а регуляторам — не сломать легитимные исследования грубыми запретами. Следующий спор, похоже, будет не о том, нужны ли ограничения, а о том, кто именно решает, где заканчивается исследование и начинается инструкция с неприемлемым риском.