Небольшой классификатор Red Hat с примерно 200 млн параметров набрал 89,01% точности в тесте на защиту от prompt injection — почти столько же, сколько Qwen3.6-35B с результатом 89,31%. При этом локальная проверка на MacBook Pro с процессором M1 занимала медианные 54,1 мс против 312,5 мс у большой модели. Для команд, которые встраивают защиту от prompt injection в путь каждого запроса к LLM, это не лабораторная мелочь, а разница между незаметной проверкой и ещё одним ощутимым сетевым хопом.
Red Hat AI Safety Team сравнила девять конфигураций guardrails в NVIDIA NeMo Guardrails, сообщает The New Stack. В тестах проверяли два разных сценария: попытки подменить инструкции модели и безопасность генерируемого контента. Сравнение свело на одной площадке специализированные классификаторы, LLM в роли судьи и так называемые decision models — модели, которые отвечают на набор формализованных вопросов, а не генерируют развёрнутый текст.
Главный вывод первого теста неудобен для любителей универсальных решений: для чётко определённой угрозы маленькая профильная модель пока выглядит очень убедительно. DeBERTa-классификатор Red Hat уступил Qwen всего 0,3 процентного пункта, но отработал почти в шесть раз быстрее. Формальное сравнение по числу параметров тоже требует оговорки: Qwen3.6-35B использует архитектуру mixture-of-experts и активирует около 3 млрд параметров на токен. Однако даже с этой поправкой преимущество компактного классификатора по задержке никуда не исчезает.
Где компактная модель выигрывает, а где уже нет
В проверке контентной безопасности лидер сменился. Решение Jev от TypeSafe AI показало 86,20%, открытая модель DiffusionGemma — 85,53%, а Qwen — 85,47%. Специализированный Granite Guardian с 125 млн параметров набрал 80,27% и оказался шестым, хотя остался самым быстрым вариантом: медианная задержка составила 33,2 мс. Политика проверки здесь была заметно шире, чем в случае инъекций: она охватывала предубеждения, насилие, нецензурную лексику, незаконные действия, сексуальный контент и маскировку вредных запросов под ролевую игру.
Именно на таких широких и меняющихся правилах decision models выглядят практичнее. Их обещание простое: сохранить гибкость языковой модели для классификации, но не платить за генерацию текста, который приложению не нужен. Jev принимает состояние приложения и типизированные вопросы, а возвращает типизированные ответы — например, вероятность от нуля до единицы. Но бенчмарк не даёт повода объявлять этот подход новым стандартом. Jev не победил одновременно и по точности, и по скорости: Qwen в конфигурации Red Hat показал меньшую медианную задержку в обоих наборах тестов.
Кроме того, закрытую API-модель Jev подпирают open source-альтернативы. DiffusionGemma отстала от неё на контентном тесте лишь на 0,67 процентного пункта, а в задаче с инъекциями даже превзошла её: 87,72% против 86,35%. Ещё одна открытая decision model, Laya примерно на 421 млн параметров, набрала 85,44% в защите от prompt injection и запускалась Red Hat на CPU ноутбука. Но на контентной безопасности её результат сильно зависел от формулировки политики — как раз тот случай, когда красивый процент без приложенного промпта мало о чём говорит.
Промпт остаётся частью системы безопасности
Тесты Red Hat особенно полезны тем, что показывают роль настройки политики. Точность Nemotron в выявлении prompt injection выросла с 69,37% до 84,84%, когда команда заменила стандартные определения рисков NVIDIA на собственные. У Laya показатель контентной безопасности поднялся с 57,87% до 75,20% после отдельной настройки политики. Та же переработка, впрочем, снизила результат Jev с 86,20% до 82,53%. Один и тот же набор правил не нейтрален: он способен добавить почти 18 пунктов одному участнику и отнять 3,67 пункта у другого.
Для разработчиков и платформенных команд из этого следует довольно приземлённый план. Не стоит выбирать guardrail по единственной таблице лидеров или размеру модели. Если риск хорошо описан, данных для обучения достаточно, а проверка стоит на каждом запросе, компактный классификатор на CPU даст предсказуемую задержку, меньше внешних зависимостей и не потребует отдельного GPU-кластера. Если политика часто меняется, охватывает много спорных категорий или размеченных данных нет, разумнее экспериментировать с LLM-судьёй либо decision model — но вместе с версионированием промптов, регрессионными тестами и мониторингом ложных срабатываний.
Замеры задержки также нельзя читать без контекста развёртывания. DeBERTa, Laya и BART-large-mnli работали на CPU MacBook Pro M1. Qwen, Nemotron, Shieldstral и DiffusionGemma запускались через vLLM на GPU-узлах с 96 ГБ видеопамяти в кластере Red Hat OpenShift Service on AWS в регионе US East, а Jev вызывался по API TypeSafe. Сам бенчмарк выполнялся из Великобритании, поэтому любой размещённый в США сервис получал трансатлантическую задержку; Red Hat оценила её минимум в 56 мс на запрос. Даже после вычета этой поправки Qwen остаётся в несколько раз медленнее локального DeBERTa, но сравнение не заменяет собственный нагрузочный тест в целевой топологии.
Red Hat планирует сделать оба своих классификатора конфигурациями guardrails по умолчанию в OpenShift AI 3.6, однако авторы теста признают необходимость улучшать компактные предиктивные модели для контентной безопасности. Есть и ещё одно ограничение: использовались только англоязычные датасеты, поэтому перенос результатов на русскоязычные запросы нельзя считать доказанным. Следующая важная проверка для рынка — появятся ли сопоставимые наборы тестов для разных языков и отраслевых политик, или защита LLM останется соревнованием не только моделей, но и тех, кто точнее написал промпт. Подробные результаты бенчмарка опубликованы у .