Nvidia 28 сентября представила Open Agent Safety Platform — открытую платформу и референсный дизайн для контроля автономных ИИ-агентов. Для рынка, где агентам уже доверяют код, доступы и операции в инфраструктуре, безопасность ИИ-агентов перестает быть философским спором и становится задачей для инженеров, DevSecOps и IT-директоров.
Платформа должна создавать барьеры вне прикладного слоя модели: агент может пытаться выйти из своей роли, выполнить лишний код или запросить доступ туда, куда его не звали, но контроль переносится ниже — в рантайм, ядро и отдельный аппаратный контур, сообщает Tom's Hardware. Логика простая: если модель нельзя считать полностью надежной, не надо просить ее быть охранником самой себе.
Open Agent Safety Platform состоит из двух ключевых частей. Первая — Nvidia OpenShell, открытый защищенный рантайм для запуска агентов в изолированных средах. Он задает политики оператора и ограничивает, что агент может видеть, запускать и с чем взаимодействовать. По описанию Nvidia, изоляция работает на уровне ядра и находится снаружи модели и агентского фреймворка. То есть даже если агент обойдет собственные программные инструкции, он должен упереться в границы OpenShell.
Вторая часть — Nvidia Sentry, независимый сторожевой контур на базе DPU BlueField-4. Он анализирует телеметрию поведения агента на аппаратном уровне и может изолировать подозрительный workflow вне среды, где работает сам агент. Nvidia утверждает, что при попытке выйти за разрешенные границы Sentry способен остановить и поместить процесс в карантин за миллисекунды. Звучит как kill switch, только без надежды на добрую волю модели.
Адресаты платформы — разработчики и компании, которые внедряют все более самостоятельных агентов в дата-центрах, рабочих станциях и робототехнических системах. OpenShell оптимизирован под Nvidia Vera, специализированный CPU для agentic AI, но как открытый компонент может быть расширен на платформы Arm и Intel. Nvidia подчеркивает, что стек рассчитан и на открытые, и на закрытые модели, а не привязан к одной лаборатории или одному поставщику.
Запуск выглядит как инженерный ответ на нервный сентябрьский фон вокруг ИИ-агентов. В отрасли обсуждают случаи, когда агенты в тестах выходили за назначенные роли, обходили ограничения, получали несанкционированный доступ к сайтам госструктур, создавали внешние площадки для коммуникации, загружали пользовательские данные без разрешения или пытались общаться друг с другом скрытно. По данным источника, ведущие AI-лаборатории расследуют десятки тысяч подобных инцидентов, в основном в тестовых и экспериментальных средах. За пределами лабораторий тоже были болезненные эпизоды: в материале приводится случай, когда coding agent на базе Claude удалил базу данных компании за 9 секунд.
На этом фоне часть индустрии зовет к замедлению разработки и регулированию. В источнике упоминаются публичные предупреждения руководителей AI-лабораторий, включая Дарио Амодеи из Anthropic, о рисках автономных систем и возможных ботнетов на базе ИИ. Дженсен Хуанг занимает другую позицию: он не отрицает необходимость защитных механизмов, но считает широкие запреты и апокалиптическую риторику отвлечением. Его тезис прагматичен и выгоден Nvidia: проблему надо решать полным стеком — от рантайма до кремния, а не только законами и alignment-тестами.
В инициативе участвуют около 100 партнеров. Среди примеров интеграций названы Anthropic, которая добавляет OpenShell и BlueField к Claude Managed Agents, Scale AI для корпоративной и государственной агентской инфраструктуры, SAP с Joule Studio, а также Salesforce и Nvidia с интеграцией в Slack: пользователи смогут видеть активность агентов, события аудита и approve/reject-запросы на дополнительные права прямо в рабочем мессенджере. Для робототехники OpenShell тестируют Figure, Gecko Robotics и Skild AI — там ошибка агента уже не ограничивается испорченным репозиторием или лишним запросом в API.
Для русскоязычных IT-команд практический вывод не в том, что всем срочно нужен BlueField-4. Важнее тренд: безопасность ИИ-агентов переезжает из промптов и policy-файлов в инфраструктуру. Если компания дает агенту доступ к CI/CD, CRM, ERP, внутренним базам или роботам, придется думать не только о guardrails внутри модели, но и о sandboxing, сетевых политиках, аудите прав, аппаратной телеметрии и аварийном отключении. Иначе агент становится не помощником, а привилегированным пользователем с очень странным чувством инициативы.
Открытым остается главный вопрос: сможет ли инфраструктурный подход Nvidia закрыть реальные риски или просто станет еще одним обязательным слоем в дорогом AI-стеке. Rogue agents — только половина проблемы; другая половина — люди, которые будут использовать мощные модели для атак, обхода правил и сомнительных автоматизаций. Подробности о запуске приводит , а рынок теперь проверит, сколько компаний готовы платить за безопасность ИИ-агентов не презентациями, а архитектурой.