Исследователи из Ben-Gurion University предложили проверять безопасность ИИ не только по входным и выходным токенам, но и по внутренним активациям модели. Для команд, которые уже строят продукты на LLM и устали от гонки между jailbreak-промптами и фильтрами, это важный сдвиг: речь идет о попытке ловить не формулировку запроса, а само намерение модели выполнить нежелательное действие.
О подходе пишет Dark Reading. Команда Offensive AI Research Lab собирается представить его на Black Hat USA 2026, который пройдет в Лас-Вегасе с 1 по 6 августа. Вместо привычной схемы, где защита следит за текстом запроса и ответа, авторы предлагают анализировать внутренние состояния LLM и выделять в них так называемые когнитивные элементы: более мелкие признаки действий и намерений вроде «создать контент», «передать», «кликнуть», «ввести» или «личные данные».
Правила безопасности предлагают строить по внутренним сигналам модели
Из таких элементов исследователи предлагают собирать правила почти как в классических системах ИБ. Если объединить признаки создания контента, передачи информации, ввода данных и упоминания персональных сведений, можно получить правило, которое сигнализирует о потенциальном фишинге.
Идея в том, чтобы не вешать на модель грубые ярлыки вроде «киберпреступление» или «дезинформация», а раскладывать риск на составные части и отслеживать их комбинации. Руководитель лаборатории Yisroel Mirsky прямо сравнил такой подход с правилами Snort и YARA: сложная математика остается под капотом, а специалист по безопасности работает с понятным слоем политик и детектов.
Почему фильтров по токенам уже недостаточно
Проблема, на которую указывают авторы, знакома любой команде, запускавшей LLM в production. Большинство защитных механизмов вокруг генеративных моделей до сих пор работают по принципу черного ящика: система смотрит на токенизированный запрос, иногда на ответ, и пытается на поверхности поймать опасный шаблон.
Это быстро и сравнительно дешево, но такие ограничения обходят перефразированием, переводом на другой язык, разбивкой инструкции на несколько шагов или уязвимостями в самой обвязке. Dark Reading приводит показательный пример: иногда достаточно сменить язык промпта, чтобы защита, завязанная на тексте, начала пропускать то, что раньше блокировала. Для русскоязычного рынка это не академический нюанс: корпоративные сценарии с LLM в России и СНГ почти всегда многоязычные, а значит защита, зависящая от формулировки, изначально стоит на зыбкой почве.
Анализ активаций пытается зайти глубже. Логика простая: если модель на любом языке приходит к одной и той же опасной задаче, это должно проявляться в сходных паттернах активации нейронов. Отсюда и главное обещание подхода: языковая независимость и большая устойчивость к обходам через хитрую упаковку запроса.
GAVEL пока выглядит как исследовательский слой защиты
Система получила название GAVEL — Governance via Activation-based Verification and Extensible Logic. В апрельской статье на arXiv авторы описали ее как rule-based framework для мониторинга активаций: вместо широких категорий система работает со словарем когнитивных элементов и позволяет собирать из них проверяемые правила.
В статье есть и менее очевидный пример: сочетание признаков вроде «конспирологический», «эмоционально вовлекать», «маскироваться под человека» и «поддакивать» может указывать на риск бредовых или манипулятивных сценариев. Для команд, которые внедряют AI-помощников в поддержку, продажи и внутренние сервисы, это уже не теория, а вопрос комплаенса, бренда и юридической ответственности.
При этом Mirsky не продает магию. Он прямо говорит, что проект остается исследовательским: специалисты все еще «ищут на ощупь» и строят гипотезы о том, как надежно читать внутренние состояния моделей. Поэтому на короткой дистанции GAVEL выглядит не как готовый отраслевой стандарт, а как еще один слой защиты поверх модерации текста, контроля инструментов, прав доступа и sandboxing.
Значение для рынка
Если подход взлетит, у корпоративных LLM и AI-агентов появится более переносимый способ описывать риск внутри модели, а не только на уровне текста. Для российских и СНГ-команд это особенно актуально в многоязычных продуктах, агентных сценариях и проектах с жесткими требованиями к ИБ: там цена ложного пропуска обычно выше, чем цена еще одного защитного слоя.
Следующий шаг команда покажет на Black Hat USA 2026: исследователи обещают привезти не только саму идею, но и набор инструментов, код и правила для сообщества. Оригинал: .