AI И НЕЙРОСЕТИ

Почему AI-агенты на одном ИИ съедают бюджет с разницей в 70 раз

70-кратный разрыв в расходе токенов показал: стоимость AI-агентов зависит не только от модели, но и от обвязки, кэша и числа итераций.

✍️ Редакция iTech News | 28.08.2026 | ⏱ 5 мин | Источник: The New Stack
🧬

Один и тот же ИИ для написания кода может обходиться команде в разы дороже просто из-за того, какая обвязка стоит вокруг модели. По данным нескольких бенчмарков, на которые ссылается The New Stack, разница в расходе токенов между Aider и OpenClaw при одинаковой модели доходила примерно до 70 раз. Для тех, кто считает стоимость AI-агентов по прайсу модели и успокаивается, это плохая новость: деньги утекают не только в сам LLM, но и в агентный «каркас».

Речь идет сразу о трех наборах измерений. В июне независимый автор сравнил 12 конфигураций на 12 Python-задачах, прогнав их через OpenRouter с одной и той же моделью. В августе Composio протестировала восемь agent harnesses на 30 enterprise-сценариях с DeepSeek V4 Flash: задачи охватывали Airtable, Gmail, Google Calendar, Google Sheets, GitHub, Slack и PostHog, а на каждую давалось до 900 секунд. Параллельно Artificial Analysis продолжает вести индекс пар «модель плюс агентная оболочка» на наборе из 326 задач, усредняя результат по трем попыткам. Иначе говоря, это уже не единичный скриншот из X, а повторяющийся паттерн.

Самый показательный эпизод дал июньский тест. В нем токены на одну успешно решенную задачу расходились от примерно 3500 у Aider в architect mode до 292 000 у OpenClaw. Важнее даже не сам разрыв, а то, что порядок почти не изменился при смене модели: сначала запускали DeepSeek V4 Flash, затем Nvidia Nemotron 3 Ultra. Если ранжирование сохраняется на двух разных моделях, проблема с высокой вероятностью не в «характере мышления» LLM, а в том, как именно агент с ней разговаривает: сколько служебного текста шлет, как описывает инструменты, как собирает контекст и сколько раз повторяет одно и то же.

Авторы материала называют это startup tax, и термин тут удачный. До того как агент вообще начал полезную работу, он уже отправил провайдеру свой системный промпт, описание инструментов и куски окружения. В том же июньском сравнении эта стартовая нагрузка составляла около 700 токенов у Aider в architect mode и около 26 000 у OpenClaw. На одном ходе это выглядит как неприятная, но терпимая плата. Но агент не живет одним ходом: если такая «подложка» пересылается 10-15 раз, бюджет раздувается без всякой бизнес-пользы. В статье приводится простой расчет: при полу в 26 000 токенов и 15 итерациях только служебная обвязка может съесть около 390 000 входных токенов.

Есть и второй фактор, который особенно неприятен для платформенных команд: кэш. Composio обнаружила, что у Claude Code только 1,5% входных токенов приходилось на cache hits, тогда как у Codex этот показатель был около 70%, а у OMP — 57%. Это критично, потому что свежие входные токены стоят примерно в пять раз дороже кэшированных. Поэтому два инструмента могут показать сопоставимое потребление токенов, но совсем разный счет на оплату. Июньский тест дал похожую картину: в прогоне с DeepSeek у Codex суммарный счет шел более чем на миллион токенов за весь набор задач, но 77% из них были cache reads и тарифицировались примерно в десять раз дешевле обычного ввода. На бумаге Claude Code использовал меньше сырых токенов, а по реальной стоимости оказывался дороже.

Отсюда следует вывод, который многим не понравится: стоимость AI-агентов определяется не только качеством модели и не только длиной промпта. Имеет значение весь serving path — через какой endpoint идет запрос, как gateway переводит формат сообщений, как устроен prompt caching и не ломается ли он на конкретном диалекте API. The New Stack отдельно отмечает, что в наблюдаемой конфигурации Claude Code был единственным инструментом, который общался с OpenRouter через endpoint в стиле Anthropic, и именно это могло ухудшить долю попаданий в кэш. Формулировка осторожная, и это правильно: такие эффекты зависят от маршрутизации и могут меняться. Но для FinOps- и platform-команд сигнал вполне ясный: прежде чем мигрировать на другую модель, полезно хотя бы один день померить долю кэшированных токенов на своем реальном трафике.

При этом дешевые агенты не автоматически лучшие, а дорогие не обязательно бесполезны. Composio зафиксировала разброс по качеству: успешность восьми harnesses колебалась от 46,7% у OpenCode до 66,7% у Pi Agent. Claude Code и DeepAgents, как пишет издание, показали одинаковый pass rate, но одна успешная задача у Claude Code стоила примерно в четыре раза дороже. Это важная поправка для закупок и внутренних сравнений: метрика «цена за задачу» сама по себе мало что говорит, если не учитывать, сколько задач инструмент реально доводит до конца. Еще один неприятный нюанс — поведение под длинным мусорным контекстом. В июньском тесте перед задачами подмешивали 100 000 токенов нерелевантных логов, и часть систем спокойно «съедала» 83-89% этого ввода, при этом формально продолжая отчитываться об успехе. Такой режим опаснее простого падения: инженер видит красивый ответ и не видит, что агент тихо отбросил значительную часть входных данных.

Для разработчиков и руководителей вывод довольно приземленный. Если компания выбирает агентную платформу в этом квартале, ей мало сравнить Claude, DeepSeek, OpenAI или любую другую модель по прайсу за миллион токенов. Надо смотреть на стоимость AI-агентов через призму проверенного результата: сколько стоит успешно выполненная задача, какова стартовая токеновая нагрузка, сколько ходов делает агент, какая доля токенов попадает в кэш и не режет ли инструмент длинный контекст без явного предупреждения. Похоже, рынок постепенно переходит от споров про «самую умную модель» к куда более скучному, но полезному вопросу: сколько стоит вся агентная обвязка и не она ли съедает бюджет раньше, чем модель вообще успевает показать интеллект.

Поделиться: Telegram X LinkedIn