КИБЕРБЕЗОПАСНОСТЬ

Microsoft и Wiz показали ИИ-системы с результатом выше 90%

95,95% и 90,9% на CyberGym: Microsoft и Wiz показали, что AI-поиск уязвимостей лучше работает в связке из нескольких моделей.

✍️ Редакция iTech News | 29.07.2026 | ⏱ 3 мин | Источник: The Register

Гонка ИИ в кибербезопасности резко поскучнела, и это хорошая новость для рынка. Microsoft заявила, что её связка MDASH и MAI-Cyber-1-Flash набрала 95,95% на бенчмарке CyberGym, а Wiz сообщила о 90,9% у Atlas. Для разработчиков и AppSec-команд здесь важен не только рекорд, но и вывод: лучше работает не одна «самая сильная» модель, а конвейер из нескольких специализированных.

Об этом пишет The Register со ссылкой на данные Microsoft и Wiz. Но есть важная оговорка: речь не о том, что системы находят «90% уязвимостей в коде вообще», а о результатах на конкретном публичном бенчмарке. Для новости про безопасность это не придирка к формулировке, а разница между инженерией и маркетингом.

Ставка на оркестратор, а не на одну модель

Microsoft утверждает, что MDASH с моделью MAI-Cyber-1-Flash и подключением GPT-5.4 показал 95,95% на CyberGym. Для сравнения, OpenAI GPT-5.5 Cyber в тех же тестах получил 85,6%, GPT-5.6 Sol — 83,6%, Anthropic Mythos 5 — 83,8%, а Gemini 3.5 Flash Cyber в CodeMender — 83,2%.

У Wiz цифра ниже, но всё равно заметная: Atlas набрал 90,9% на CyberGym. Компания также пишет, что система нашла более 200 ранее неизвестных уязвимостей в популярном открытом ПО. Пока Atlas не продают как отдельный продукт: это внутренняя исследовательская система Wiz для продвинутого анализа кода.

Логика у обеих компаний почти одинаковая. Microsoft отдала до 90% задач более компактной модели MAI-Cyber-1-Flash, а сложные случаи маршрутизирует на GPT-5.4. Wiz использует связку Claude Opus 4.6 и GPT-5.5 и уже готовит подключение Gemini. Идея простая: одна модель лучше размечает и сортирует находки, другая сильнее в рассуждении по цепочке эксплуатации, третья аккуратнее подтверждает результат.

Что именно измеряет CyberGym

Здесь и начинается главная редакторская правка. CyberGym измеряет не абстрактный «процент найденных дыр», а способность системы воспроизвести известную уязвимость по описанию и фрагментам кода. То есть бенчмарк проверяет, насколько хорошо модель понимает уже заданную проблему и может построить рабочее доказательство эксплуатации.

Сама Wiz отдельно подчёркивает: воспроизвести известную уязвимость проще, чем найти неизвестную с нуля в живом репозитории, который меняется каждый день. Это важное уточнение для техдиров и руководителей безопасности. Заголовок в духе «нашли 90% уязвимостей» здесь был бы красивым, но неточным.

Экономика стала не менее важной, чем качество

Microsoft через главу Microsoft AI Мустафу Сулеймана заявляет, что такая архитектура снижает стоимость для клиентов примерно вдвое. Смысл понятен: дешёвая специализированная модель берёт на себя основной поток, а дорогая frontier-модель подключается только там, где без неё не обойтись.

Для рынка это сигнал посильнее самого бенчмарка. Если у компании десятки репозиториев, микросервисная архитектура и непрерывные поставки, то разовый глубокий прогон по всему коду быстро устаревает и дорого обходится. Побеждает не тот, у кого громче название модели, а тот, у кого дешевле постоянная проверка, меньше ложных тревог и лучше подтверждение находок.

Значение для рынка

Для русскоязычных команд вывод прикладной: при выборе инструментов для AppSec стоит смотреть не столько на бренд модели, сколько на процесс. Как система подтверждает уязвимость, умеет ли проверять исправление, насколько легко заменить одну модель на другую и сколько стоит постоянное сканирование на реальной нагрузке. Для стартапов в безопасности это ещё жёстче: конкурентное преимущество теперь всё чаще в оркестраторе, бенчмарках и валидации, а не в доступе к очередному «самому новому» LLM.

Если результаты подтвердятся за пределами лабораторных тестов, рынок ИИ-безопасности быстро сместится от споров о лучшей модели к более приземлённому вопросу: у кого надёжнее и дешевле работает весь конвейер поиска уязвимостей.

The Register, Microsoft AI, Wiz

Поделиться: Telegram X LinkedIn