XRanges for AI предлагает неприятно полезную вещь: проверить не то, что автономный security-агент красиво написал в отчёте, а то, что он реально сделал с целевой системой. Платформу CTF.ae уже прогнали через 545 участников на DEF CON 34, сообщает The Hacker News, и теперь её позиционируют как бенчмарк для команд, которые строят ИИ-пентестеров и bug bounty-агентов.
Проблема знакомая: агент запускают на реалистичной цели, он возвращает уверенный отчёт с находками, а дальше начинается ручная работа. Нужно понять, какие уязвимости действительно эксплуатированы, какие продублированы, какие агент просто придумал, а какие части приложения он вообще не открыл. Один прогон ещё можно разобрать руками. Но если команда сравнивает три модели, четыре варианта промпта и десять повторов, ревью быстро превращается в отдельный проект с печальной экономикой.
XRanges for AI пытается убрать из этой схемы главный шум. Платформа разворачивает изолированные многосервисные приложения с бизнес-логикой, тестовыми данными, фоновыми задачами и имитацией пользовательского трафика. Это не набор CTF-задач в вакууме, а модель компании, собранная на нескольких языках и фреймворках. В каждый такой таргет встроено от 20 уязвимостей: от простых ошибок до цепочек, проходящих через несколько сервисов. По заявлению CTF.ae, часть багов включает zero-day, найденные их исследователями, а сами цели не лежат в публичных обучающих корпусах.
Вторая половина системы — телеметрия. Каждый сервис отдаёт структурированные события через OpenTelemetry, причём инструментацию пишут вручную под конкретный таргет. Обычного HTTP-лога тут мало: он покажет запросы, но не объяснит, зарегистрировал ли агент аккаунт, открыл ли вакансию, создал ли API-ключ или дошёл до нужного бизнес-действия. Платформа смотрит изнутри приложения, а не встаёт прокси между агентом и целью.
Оценка строится на четырёх независимых сигналах. Coverage показывает, какую легитимную поверхность агент исследовал: не URL, а пользовательские действия. Boundaries фиксирует нарушения правил, например удаление контента или отзыв API-ключей, если это запрещено условиями теста. Exploited разбирает каждую уязвимость как цепочку шагов и показывает, где агент остановился: нашёл вход, прошёл два этапа из трёх или действительно довёл эксплуатацию до конца. Integrity каждую минуту проверяет, жива ли система: на месте ли данные, отвечают ли сервисы, не сломаны ли доверительные связи между компонентами.
Самое ценное здесь не итоговый балл, а разбор по слоям. Если агент заявил об access control flaw, но телеметрия видит только первые два шага цепочки, это уже не «почти эксплойт», а конкретная недоделанная попытка. Если он нашёл баг, но по дороге снёс важные данные, это тоже результат — только скорее характеристика агента, чем победа над целью. Для бизнеса такая разница принципиальна: клиенту нужен не литературный отчёт, а понимание, можно ли пускать автономный инструмент в среду, где есть реальные данные и SLA.
Один таргет, по данным разработчиков, разворачивается примерно за 90 секунд как изолированная multi-container-среда. Платформа выдерживает до тысячи параллельных деплоев, а у каждого запуска можно хранить метаданные: модель, версию агента, вариант промпта, автора эксперимента. Это важно для команд, которые пытаются отличить настоящий прогресс от удачного единичного забега. Один прогон автономного агента вообще мало что доказывает: сегодня он попал в нужную ветку, завтра уверенно прошёл мимо неё.
Есть и автоматизация для инженерного конвейера. Консоль дополняют API и MCP-сервер с bearer-токеном: можно разворачивать пачки целей, запускать агента, собирать покрытие, прогресс по kill chain и сравнение запусков из CI или внутреннего ассистента. Для разработчиков ИИ-агентов это означает более нормальную экспериментальную дисциплину: не «модель написала убедительно», а «модель стабильно проходит эти цепочки, не ломает окружение и не игнорирует половину продукта».
Полевой тест прошёл на Bug Bounty Village во время DEF CON 34 в августе 2026 года. CTF.ae построила таргет Xenoptic — вымышленную AI-компанию со сложным scope. 545 зарегистрированных игроков получили собственные изолированные копии окружения, всего было более 850 деплоев, а система 48 часов собирала те же четыре сигнала: целостность, границы, покрытие и реальные эксплуатации. Для соревнования это вопрос справедливости: отчёт участника сам по себе не доказывает, каким путём он получил флаг и не использовал ли побочный дефект.
Для русскоязычных security-команд вывод довольно практичный: рынок автономных ИИ-пентестеров упирается не только в качество моделей, но и в измеримость. Пока агент сам себе пишет характеристику, его сложно сравнивать, сертифицировать и безопасно подключать к рабочим системам. Следующий рубеж — не более громкие демо, а проверяемые прогоны, где видно и найденные баги, и слепые зоны, и цену каждой находки для инфраструктуры. Подробности о запуске XRanges for AI опубликованы у .