АНАЛИТИКА

DeepSeek снизила цены на 75%, но экономика AI-агентов хуже не стала

DeepSeek урезала цену V4-Pro на 75%, но стоимость AI-агентов продолжает расти: токены в агентных цепочках сгорают быстрее, чем дешевеет инференс.

✍️ Редакция iTech News | 13.07.2026 | ⏱ 6 мин | Источник: VentureBeat
📊

DeepSeek снизила цену на модель V4-Pro сразу на 75%, но стоимость AI-агентов от этого не стала комфортной. Для команд, которые строят агентные сценарии поверх LLM, это плохая новость: дешевеет не вся система, а только один ее слой, тогда как расход токенов в боевых цепочках продолжает расти.

Об этом пишет VentureBeat, разбирая то, что авторы называют проблемой 100x. Логика простая и неприятная для любого B2B-продукта с ИИ: пользователь видит один ответ, а в бэкэнде за него могут сработать планирование, поиск по базе знаний, вызовы инструментов, проверка результата, сводка и еще несколько шагов. Для поставщика это не один вызов модели, а серия оплачиваемых операций.

На бумаге все выглядело иначе. Последние два десятилетия software-бизнес жил с понятной экономикой: инфраструктура дешевеет, приложения становятся мощнее, маржа у тех, кто умеет упаковать это в продукт, сохраняется. В генеративном ИИ многие ожидали того же сценария. Модели улучшаются, цена за токен падает, значит инференс со временем превратится в фоновую статью затрат. Но агентные системы ломают эту схему, потому что потребляют токены быстрее, чем провайдеры снижают прайс.

VentureBeat приводит показательный разбор. Если классический чат-бот обычно превращает один вопрос в один модельный вызов, то агент раскладывает тот же запрос на цепочку шагов. В примере с простым корпоративным вопросом вроде «что спрашивал наш крупнейший клиент на прошлой неделе?» набирается около семи платных операций: пользовательский запрос примерно на 50 токенов, системный промпт и описания инструментов примерно на 3000 токенов, извлеченный контекст примерно на 5000, затем отдельный вызов на выбор инструмента, возврат данных из инструмента, вызов на суммаризацию и еще один вызов на решение, нужен ли следующий шаг. В итоге одна короткая фраза на входе превращается примерно в 35 тысяч оплачиваемых входных токенов. По оценке издания, это может стоить от 10 до 40 центов за запрос на frontier-модели. При миллионе запросов в месяц, а для корпоративной фичи это уже не экзотика, счет легко уходит в шестизначную зону.

Почему дешевый токен не спасает SaaS-модель

Главная проблема даже не в абсолютной цене инференса, а в том, что ломается привычная подписочная математика. Большая часть enterprise AI по-прежнему продается как seat-based SaaS: условные 30, 40 или 50 долларов за пользователя в месяц, а внутри уже обещаны «умные агенты», автоматизация и ускорение команды. Такая модель работала, пока стоимость обслуживания одного пользователя была более-менее ограниченной. Но если активный клиент запускает по 50 агентных обращений в день, его месячный счет за инференс может оказаться выше, чем он платит по тарифу.

Отсюда и неприятный парадокс: самые вовлеченные пользователи, которые получают больше всего пользы от продукта, могут приносить меньше всего прибыли. VentureBeat пишет, что часть вендоров уже в частном порядке жалуется на отрицательную валовую маржу по heavy users. Для рынка это особенно болезненно потому, что рост потребления агентов обычно подается совету директоров как признак product-market fit и будущего upsell, а на практике именно этот рост начинает давить на P&L.

В материале упоминается еще один симптом. Bloomberg, по словам VentureBeat, зафиксировал растущий разрыв между маркетинговыми демо Salesforce Agentforce и тем, что реально доезжает до клиентов. Такая дистанция выглядит вполне предсказуемо, когда технология в принципе работает, но ее слишком дорого выдавать в проде по той цене, которую подразумевает подписка. Salesforce здесь просто самый заметный пример, а не исключение. Еще жестче это формулирует вице-президент Nvidia по Applied Deep Learning Брайан Катанзаро: для его команды вычислительные затраты уже выше затрат на сотрудников. Для индустрии это звучит не как красивая гипербола, а как довольно ясный финансовый диагноз.

На этом фоне показательна и другая цифра из текста: OpenAI предложила выдавать каждому стартапу из Y Combinator по 2 миллиона долларов в API-кредитах. Еще несколько лет назад ранним командам хватало сравнительно скромных облачных кредитов, чтобы запустить продукт и проверить гипотезы. Теперь сам рынок как будто признает: AI-native компания в первый год жизни способна сжечь на моделях бюджет, который в прошлую эпоху выглядел бы как полноценный seed.

Новый ров: не модель, а оркестрация

Из этого не следует, что агентный подход обречен. Скорее меняется точка конкуренции. Если раньше преимуществом считался доступ к более сильной модели, то теперь все большее значение получает инженерия оркестрации. VentureBeat перечисляет набор мер, которые уже перестают быть nice to have и становятся вопросом выживания. Первая — cost-aware routing, когда небольшой классификатор решает, какой класс модели нужен для конкретного запроса. Хорошо настроенный роутер, по оценке издания, способен сократить счет за инференс примерно на 60% без заметной потери качества. Вторая — кеширование промптов: Anthropic, OpenAI и Google уже дают скидки порядка 75-90% на повторно используемые префиксы. Третья — дисциплина контекста: обрезать выводы инструментов, чистить reasoning traces, ограничивать глубину циклов, чтобы агент не уходил в дорогую самодеятельность. Четвертая — speculative decoding в self-hosted-сценариях, где можно получить в 2-3 раза больше пропускной способности на тех же GPU.

Для разработчиков и продуктовых команд это означает неприятную, но полезную смену оптики. Архитектурное решение теперь напрямую равно финансовому решению. Раздувшийся системный промпт на 4000 токенов — уже не эстетическая проблема и не повод для будущего рефакторинга, а медленно тикающий счет на сотни тысяч долларов. Роутер между моделями — это не optimization pass на потом, а такой же базовый инфраструктурный компонент, как load balancer. Метрики инференса по tenant, feature и классу запросов нужно вести так же строго, как несколько лет назад начали вести облачные расходы. Иначе компания узнает о популярности своей AI-функции одновременно с тем, что на ней невозможно зарабатывать.

Для русскоязычного рынка вывод тоже вполне прикладной. Компании, которые сейчас спешно прикручивают AI-агентов в поддержку, продажи, legal ops или внутренние сервис-дески, рискуют повторить ту же ошибку, что раньше делали с облаками: сначала запускать «как работает», а считать потом. Проблема в том, что у агентных систем «потом» наступает очень быстро. Если продукт продается по фиксированной подписке, а стоимость AI-агентов скачет вместе с активностью клиента, экономическая модель начинает трещать раньше, чем команда успевает отполировать UX и дописать лендинг.

Снижение цен у DeepSeek показывает: базовый инференс и дальше будет дешеветь, причем быстро. Но рынок уже уткнулся в другой потолок: не в цену одного токена, а в то, сколько токенов продукт сжигает ради одной видимой для пользователя операции. В ближайшие кварталы выиграют не те, кто подключит самый дешевый LLM-прайс, а те, кто научит своих агентов думать короче, реже и по делу.

Поделиться: Telegram X LinkedIn