Microsoft открыла исходный код сразу двух инструментов для команд, которые строят ИИ-агентов: RAMPART и Clarity. Для рынка, где все любят показывать демо, а не threat model, это важный сигнал: безопасность ИИ-агентов начинают встраивать не в презентации для совета директоров, а в обычный инженерный цикл.
О выпуске сообщает Habr / Новости. Оба проекта уже доступны на GitHub, но задачи у них разные: RAMPART проверяет, как агент ведет себя под атакой, а Clarity помогает разобрать архитектурные риски еще до того, как команда успела написать полсервиса и назвать это MVP. В сумме получается довольно приземленный набор: меньше магии, больше дисциплины.
RAMPART Microsoft описывает как фреймворк для тестов безопасности, оформленных в привычном для Python-разработчика виде — через pytest-сценарии. Это не отдельная экзотическая платформа, которую нужно объяснять всей команде на трех встречах подряд, а инструмент, который можно поставить рядом с обычными интеграционными тестами. Под капотом он опирается на PyRIT, открытую платформу Microsoft для проверки генеративных моделей. Сценарий выглядит так: разработчик берет угрозу из своей модели рисков, подключает к тесту агента, прогоняет взаимодействие и получает бинарный результат — тест пройден или нет. Если нет, сборка в CI может остановиться ровно так же, как она останавливается из-за упавшего теста на бизнес-логику.
На практике это означает довольно неприятную, но полезную вещь: добавил агенту новый инструмент, внешний источник данных или очередной «умный» workflow — будь добр, приложи в том же pull request проверку на безопасность ИИ-агентов. Идея здравая, потому что именно на стыках и начинаются проблемы. Агент может выглядеть безопасным в изолированном чате, а потом внезапно получить вредоносную инструкцию из письма, тикета, документа или другого контента, который он обрабатывает как данные, а не как команду. Именно на такие атаки через prompt injection RAMPART сейчас нацелен в первую очередь.
Здесь важен еще один нюанс, который редко аккуратно проговаривают в корпоративных анонсах. Языковые модели ведут себя вероятностно: один и тот же сценарий сегодня проходит, завтра дает сбой, а послезавтра ведет себя «в целом нормально», если очень захотеть так это интерпретировать. RAMPART учитывает эту специфику и позволяет гонять один и тот же тест несколько раз с порогом успешности. В примере из описания фигурирует логика вроде «действие должно быть безопасным минимум в 80% запусков». Для классического software testing это звучит почти кощунственно, но для агентных систем ближе к реальности, чем разовая зеленая галочка, после которой все дружно делают вид, что риск закрыт.
Clarity работает на другом этапе и с другой проблемой. Это не инструмент тестирования, а помощник по проектированию, который задает команде неудобные вопросы до начала разработки. Логика примерно такая же, как у сильного архитектора или security reviewer на раннем design review: не дает спрятать сложность под ковер и просит объяснить, что произойдет в нестандартных сценариях. В примере из описания команда хочет добавить совместное редактирование документа, а Clarity спрашивает, что будет, если два человека одновременно меняют один и тот же абзац. В обычной продуктовой гонке такие вопросы любят откладывать «на потом», а потом внезапно оказывается, что потом уже продакшен.
Отдельно полезно, что результаты работы Clarity складываются в директорию .clarity-protocol/ прямо внутри репозитория и сохраняются как обычные markdown-файлы. То есть архитектурные решения, допущения и спорные места можно коммитить, ревьюить и сравнивать через diff вместе с кодом, а не искать их по заметкам в Notion, скриншотам из чата и памяти самого уставшего инженера в команде. Microsoft также указывает, что систему независимо просматривают несколько ИИ-«аналитиков», каждый со своего угла: безопасность, человеческий фактор, операционные риски. Даже если относиться к формулировке с осторожностью, сам подход понятен: не ждать единственного правильного ответа от одной модели, а специально раскладывать анализ по разным осям.
Для русскоязычной IT-аудитории здесь интересен не только сам релиз, но и подход, который за ним стоит. Вокруг ИИ-агентов рынок быстро нарастил слой разговоров про автономность, productivity и новые интерфейсы, а теперь приходится возвращаться к скучным, но взрослым вопросам: где агент берет инструкции, какие у него права, как он работает с внешними данными, что считается опасным действием и как это проверять не вручную раз в квартал, а постоянно. Microsoft, по сути, предлагает собрать цикл из двух частей: сначала зафиксировать проектные решения и риски в Clarity, потом превращать редтиминг, реальные инциденты и новые угрозы в регрессионные тесты через RAMPART. То есть безопасность ИИ-агентов предлагается вести как живую инженерную практику, а не как разовый аудит перед большим релизом.
Для разработчиков это может оказаться самым полезным элементом всей истории: безопасность наконец пытаются встроить в знакомые процессы, а не вынести в отдельный ритуал с собственным словарем и отдельной командой, которая приходит в финале и запрещает жить. Для бизнеса сигнал тоже довольно прямой. Чем активнее компании дают агентам доступ к письмам, документам, тикетам, внутренним базам знаний и действиям в рабочих системах, тем выше цена ошибки от prompt injection и смежных сценариев. Вопрос уже не в том, нужен ли агенту guardrail на демо, а в том, готовы ли команды поддерживать этот guardrail после каждого изменения продукта.
Похоже, следующий этап рынка ИИ-агентов будет определяться не числом эффектных сценариев на сцене, а тем, кто научится системно проверять свои агентные цепочки на сбой и злоупотребление. И если такие инструменты действительно приживутся в CI и design review, у индустрии появится шанс перейти от культуры «ну модель же обычно ведет себя нормально» к более взрослой привычке сначала моделировать риск, а потом уже подключать агенту еще один доступ к боевым данным.