КИБЕРБЕЗОПАСНОСТЬ

Как сократить расходы на ИИ в безопасности без потери качества

Фронтирные модели могут стоить примерно в пять раз дороже за токен, но в рутинной проверке дают лишь 1-2% прироста точности.

✍️ Редакция iTech News | 26.08.2026 | ⏱ 4 мин | Источник: The New Stack

Фронтирные модели в security выглядят эффектно ровно до первого счёта за инференс. Как пишет The New Stack, команды, которые гоняют дорогие модели на рутинный поток проверок, всё чаще пересматривают расходы на ИИ: в одном из описанных кейсов более лёгкая схема дала разницу в точности всего 1-2%, зато заметно снизила стоимость обработки. Для русскоязычных команд это довольно прямой сигнал: экономить можно не за счёт урезания защиты, а за счёт нормальной архитектуры пайплайна.

Повод для разговора простой. В security-операциях и trust & safety много однотипной, массовой работы: проверка подозрительных аккаунтов, фильтрация злоупотреблений, первичная классификация событий. Ставить на каждый такой запрос самую мощную модель удобно, но быстро становится дорогой привычкой. The New Stack описывает подход, в котором дорогой LLM перестаёт быть значением по умолчанию и используется только там, где действительно нужен его запас по качеству.

Ключевая идея выглядит не как магия, а как вменяемый инженерный компромисс. На входе ставятся детерминированные, rules-based фильтры: возраст аккаунта, почтовый провайдер, особенности поведения и другие заранее известные сигналы. Всё, что они могут отсечь без участия модели, отсеивается сразу. Дальше оставшийся поток уходит в более лёгкую модель, а до дорогой, более мощной, доходят только неоднозначные случаи с низкой уверенностью классификации. Иными словами, фронтирная модель работает не в роли швейцара на входе, а в роли эскалации для сложных кейсов.

Самая неприятная для сторонников подхода «берём максимум и не думаем» цифра в том, что при структурированном тестировании разница между лёгкими и фронтирными моделями составила лишь 1-2% по точности. При этом более мощные модели, по данным материала, стоят примерно в пять раз дороже за токен. Такая математика быстро отрезвляет: если 98% качества можно получить заметно дешевле, то привычка отправлять весь трафик в топовую модель выглядит уже не как забота о безопасности, а как плохо настроенный бюджет.

В статье приводится и совсем прикладной результат: один из руководителей security operations сумел снизить стоимость подобных проверок примерно до 1 доллара в день. Важно, что речь не о чуде оптимизации и не о том, что модель внезапно стала бесплатной. Экономия появилась из-за правильной последовательности решений: сначала простые признаки, потом дешёвый интеллектуальный слой, потом точечная эскалация в дорогую модель. Этот паттерн хорошо знаком любому, кто строил антифрод, SIEM-корреляции или очереди ручной модерации: не каждый инцидент заслуживает одинаково дорогого разбирательства.

Отдельно The New Stack подчёркивает вещь, о которой в корпоративных презентациях любят забывать. Экономика модели зависит не только от выбора провайдера, но и от качества самого запроса. В материале говорится, что некоторые промпты превышали 1900 слов, а полнота контекста оказывалась не менее важной, чем выбор между «лёгкой» и «тяжёлой» моделью. Это неудобная правда для рынка: иногда проблема не в том, что команда купила «не тот» LLM, а в том, что она кормит его избыточным или плохо структурированным контекстом. В итоге расходы на ИИ растут не потому, что задача сложная, а потому, что пайплайн ленивый.

Есть и ещё один важный вывод для разработчиков и продуктовых команд. Модельный tiering в безопасности постепенно становится не экзотикой, а базовой инженерной гигиеной. Если у вас уже есть маршрутизация запросов по важности, confidence score, ручная эскалация и история срабатываний, то слой с несколькими моделями встраивается в такую систему довольно естественно. Если ничего этого нет и вся логика сводится к «отправим всё в самый умный API», проблемы будут сразу в трёх местах: в стоимости, задержках и объяснимости решений.

При этом материал не обещает полной автоматизации и не делает вид, что люди больше не нужны. Для неоднозначных кейсов, где требуется контекстное суждение, human review остаётся обязательной частью процесса. Для security это, пожалуй, даже хорошая новость: рынок постепенно отходит от идеи, что любая сложность должна растворяться внутри одного большого LLM. Скорее наоборот, выигрывать будут те команды, которые научатся точно разделять, где хватает правил, где нужен дешёвый модельный слой, а где без дорогой модели и живого аналитика всё ещё не обойтись.

На фоне общего охлаждения к tokenmaxxing это выглядит как более взрослый этап рынка. Вопрос уже не в том, сколько ИИ можно залить в процесс, а в том, на каком участке он действительно окупает себя. Для security-команд ближайшие месяцы, похоже, пройдут под знаком не гонки за самой мощной моделью, а более прозаичного соревнования: кто сумеет собрать защитный конвейер, в котором цена ошибки не растёт быстрее, чем счёт за токены.

Поделиться: Telegram X LinkedIn