АНАЛИТИКА

Почему дешевые модели не спасут бюджет на AI-агентов

Цена за миллион токенов падает, но бюджет на AI растет: агентные сценарии множат вызовы модели, ретраи и расходы на контекст.

✍️ Редакция iTech News | 05.07.2026 | ⏱ 4 мин | Источник: The New Stack
📐

Цена за миллион токенов падает, а бюджет на AI у команд все равно распухает. Причина в том, что AI-агенты тратят деньги не только на «умность» модели, но и на количество шагов, перепроверок и повторных запусков. Для российских продуктовых команд, интеграторов и внутренних платформенных команд это означает неприятную вещь: экономить придется не на вывеске модели, а на всей цепочке выполнения задачи.

Именно к этому выводу подводит свежий материал The New Stack: ставка на более дешевые модели больше не выглядит универсальным способом сократить бюджет на AI. Логика, которая работала для обычных чат-сценариев, в агентных системах начинает сбоить. Если раньше компания выбирала модель по простой формуле «качество на доллар», то теперь одного прайса за токен уже мало. В агентном контуре деньги сгорают на оркестрации, промежуточных шагах, длинном контексте, валидации ответа и повторных попытках, когда система сама себя исправляет или проверяет результат через дополнительные вызовы.

Это важный сдвиг. Обычный пользовательский запрос к LLM часто сводится к одному обмену: отправили промпт, получили ответ, на этом все. Агентный сценарий устроен иначе. Модель получает задачу, разбивает ее на подзадачи, обращается к инструментам, читает файлы, вызывает поиск, пишет промежуточные версии, сравнивает варианты и иногда возвращается на шаг назад. Для бизнеса это значит, что стоимость одного «полезного действия» больше не равна стоимости одного ответа модели. Она складывается из целой последовательности операций. И если дешевую модель приходится дергать чаще, держать дольше в цикле или регулярно просить переписать неудачный результат, экономия быстро превращается в бухгалтерскую иллюзию.

На этом месте особенно часто ошибаются команды, которые мыслят закупкой модели, а не дизайном системы. Кажется, что если заменить дорогую LLM на более доступную, расходы автоматически снизятся. Но в агентных пайплайнах дешевый вариант может оказаться дороже в эксплуатации, если он хуже планирует, чаще теряет контекст, ошибается на ветвлениях и требует больше страховочных проверок. Парадокс неприятный, но понятный любому инженеру: слабый компонент редко удешевляет систему, если вокруг него приходится наращивать компенсирующую сложность. В результате бюджет на AI начинает съедать не «премиальная модель», а бесконечная мелкая работа по ее сопровождению внутри сценария.

Отсюда и новая практическая метрика для команд. Важно считать не цену входного и выходного токена в вакууме, а стоимость завершенной задачи: сколько вызовов потребовалось, сколько раз агент сходил в инструмент, сколько контекста протащил между шагами, сколько ретраев сделал и насколько часто операция вообще заканчивается успехом без ручного вмешательства. Для CTO и руководителей AI-платформ это уже не разговор про «какой API дешевле», а про unit-экономику агентного действия. Для продактов это вопрос воронки: если агент закрывает заявку с третьей попытки, реальная себестоимость функции может быть в разы выше, чем обещает прайс-лист поставщика модели. Для HR- и back-office-команд, которые сейчас массово автоматизируют рутину через LLM, это тоже плохая новость: самые дорогие процессы часто маскируются под самые простые.

На рынке из этого вырастает вполне взрослый тренд: компании начинают оптимизировать не модель, а маршрут. То есть решают, где действительно нужен сильный reasoning, а где достаточно короткого дешевого вызова; какие шаги можно заменить обычным кодом; где стоит сократить контекст; какие проверки нужно делать правилами, а не еще одной генерацией текста. Проще говоря, инженерия снова побеждает магию. Если у вас AI-агент открывает PDF, извлекает пару полей и раскладывает их в CRM, здесь легко потратить лишние деньги просто потому, что весь процесс зачем-то отдан LLM. Если же модель включается только там, где без нее нельзя, бюджет на AI становится предсказуемее, а качество обычно даже растет.

Для русскоязычной IT-аудитории здесь есть еще один важный слой. Местный рынок давно привык жить в условиях ограниченных бюджетов, смешанных стеков и необходимости объяснять каждую новую статью расходов. Поэтому тезис «возьмем модель подешевле и все сойдется» у нас особенно соблазнителен. Но агентные системы быстро наказывают за такой упрощенный подход. Если команда не считает полную стоимость сценария, не измеряет длину контекста, не контролирует число итераций и не разделяет задачи по уровню сложности, то финансовый сюрприз почти гарантирован. Причем он приходит не в момент пилота, а позже, когда прототип уже понравился бизнесу и начал масштабироваться на реальные процессы.

Отсюда и вполне прикладной вывод. При проектировании агентных решений нужно обсуждать не только выбор модели, но и лимиты на глубину цепочки, правила остановки, бюджет на задачу, долю шагов без LLM, кэширование, оценку качества с первого прохода и политику эскалации на более сильную модель. Это звучит менее эффектно, чем очередной спор о том, кто дешевле на миллион токенов, зато лучше отражает реальность эксплуатации. Агентный AI переводит разговор о расходах из категории «закупка API» в категорию «операционный контроль сложной системы».

Главный вопрос теперь не в том, можно ли купить интеллект дешевле, а в том, научатся ли компании строить агентные контуры, где лишний токен вообще не появляется. Пока рынок увлеченно сравнивает тарифы моделей, настоящая борьба за бюджет на AI смещается в менее гламурную зону: маршрутизацию, ограничения, наблюдаемость и дисциплину исполнения.

Поделиться: Telegram X LinkedIn