КИБЕРБЕЗОПАСНОСТЬ

AI-агенты могут сжечь бюджет без взлома: новый риск для LLM

OWASP поставил безлимитное потребление на 6-е место в Top 10 рисков LLM: AI-агенты могут раздувать счета без явной атаки.

✍️ Редакция iTech News | 22.09.2026 | ⏱ 4 мин | Источник: Dark Reading
🔒

Безлимитное потребление поднялось до шестого места в OWASP Top 10 for LLM Applications 2026 — и это не про красивую теорию безопасности, а про счета за inference, которые внезапно перестают быть похожими на бюджет. Для русскоязычных команд, которые встраивают AI-агентов в поддержку, поиск, аналитику и внутренние инструменты, риск простой: сервис может не упасть, но деньги будут утекать с бодрой скоростью.

Проблему разбирает Dark Reading со ссылкой на отчет Forcepoint. Речь идет об уязвимости LLM-приложений, при которой запрос, сессия или цепочка действий агента не имеют жестких лимитов по вычислениям, стоимости, числу шагов или объему контекста. В классической DDoS-логике команда ждет отказа сервиса. Здесь сценарий неприятнее: приложение продолжает работать, пользователи видят ответы, мониторинг доступности спокоен, а облачный биллинг уже пишет свою маленькую драму.

Исследователь Forcepoint Джотика Сингх описывает общий корень проблемы так: системе не хватает контроля над тем, сколько ресурсов один запрос или одна цепочка действий может потребить. В англоязычной среде для этого закрепилось выражение denial of wallet — атака не на доступность, а на кошелек. Для AI-продуктов с оплатой за токены, вызовы API, инструменты агента и облачные вычисления это особенно болезненно: каждый лишний шаг стоит денег, а лишних шагов у агента может оказаться очень много.

Первый сценарий Forcepoint — самый прямолинейный. Если API-ключ от тестового чат-бота поддержки утек в публичный репозиторий, злоумышленник может нагенерировать десятки тысяч запросов к платному AI-сервису. Формально это не обязательно выглядит как сложная атака: запросы могут быть обычными, модель отвечает штатно, лимиты по одному обращению не нарушены. Но владелец ключа получает счет, который легко выходит за месячный бюджет приложения.

Второй сценарий опаснее для компаний, которые уже экспериментируют с агентами, умеющими ходить по ссылкам, читать страницы, собирать материалы и вызывать инструменты. Forcepoint называет это agent tool fan-out. Представим исследовательского AI-агента, которому нужно изучить тему и перейти по релевантным источникам. Если атакующий подменит или скомпрометирует страницу, которую агент с высокой вероятностью прочитает, и добавит туда сотни «похожих материалов», агент может начать переходить по ссылкам, затем по ссылкам внутри ссылок, а потом еще раз. Нарушения инструкции нет: агент делает то, для чего его наняли. Просто делает это до тех пор, пока стоимость задачи не становится неприличной.

Третий вариант связан с reasoning-моделями, которые перед ответом выполняют дополнительные рассуждения. Короткий на вид промпт может заставить модель снова и снова проверять собственные выводы, перебирать трактовки вопроса и «думать» намного дольше, чем требуется задаче. Трафик при этом не обязательно растет: один пользователь, один запрос, один ответ. Растет невидимая часть — число токенов размышления и стоимость inference. Для команд, которые привыкли ловить аномалии по количеству запросов, это неприятный поворот.

Четвертый сценарий вообще может обойтись без злоумышленника. Длинная сессия с AI-ассистентом накапливает историю диалога, и каждый новый ответ заново обрабатывает все больший контекст. В примере Forcepoint окно поддержки остается открытым более чем на 150 обменов сообщениями. К сотому сообщению модель уже таскает за собой текст размером с небольшой рассказ, а цена одного ответа может вырасти примерно в 100 раз относительно начала разговора. Пользователь при этом просто продолжает чатиться с поддержкой, а не «атакует» систему.

Пятый сценарий — извлечение модели. Если публичный inference-endpoint не ограничивает число запросов и дополнительно раскрывает вероятности токенов или другие полезные сигналы, конкурент или злоумышленник может неделями отправлять разнообразные запросы и постепенно восстанавливать приближенную копию поведения модели. Здесь безлимитное потребление бьет уже не только по счету за облако, но и по интеллектуальной собственности.

Для разработчиков вывод довольно приземленный: защита AI-агента не заканчивается фильтром промптов и модерацией ввода. Нужны жесткие лимиты расходов и токенов на пользователя, команду, ключ API и тип операции. Нужны ограничения на число шагов агента, глубину переходов, повторные самопроверки, длину сессии и объем контекста. Алерт «расходы выросли» полезен, но он приходит после того, как деньги уже начали уходить. В случае с агентами лимит должен быть не табличкой на стене, а частью runtime-логики.

Бизнесу придется привыкнуть к новой бухгалтерии AI-продуктов. Раньше MVP с чат-ботом часто оценивали по качеству ответов и скорости интеграции. Теперь в требования придется добавлять стоимость типового сценария, максимальную стоимость одной пользовательской задачи и поведение системы при достижении лимита. Это скучно только до первого счета за облако. Особенно если агент подключен к поиску, CRM, почте, базе знаний и внешним API, где каждый шаг может тянуть за собой следующий.

Безлимитное потребление выглядит как один из тех рисков, которые взрослеют вместе с рынком. Пока AI-агенты были демо и внутренними игрушками, лишние токены воспринимались как плата за эксперименты. Когда они становятся частью поддержки, продаж, разработки и аналитики, вопрос меняется: кто в компании отвечает за то, чтобы агент не получил корпоративную карту без лимита?

Поделиться: Telegram X LinkedIn