87% компаний из опроса The Wall Street Journal вышли за первоначальные бюджеты на внедрение и эксплуатацию нейросетей. Расходы на ИИ растут не только из-за дорогих тарифов: попытка заменить сильную модель дешёвой нередко увеличивает число запросов, время команды и итоговый счёт. Для российского бизнеса это неприятное напоминание: пилот с красивой презентацией ещё не означает управляемую экономику в продакшене.
Как сообщает CNews, в исследовании участвовали 400 компаний, а данные охватывали период до мая 2026 года включительно. Лишь у 11% респондентов перерасход составил не более 11% от плана. У 39% компаний фактические траты превысили прогноз на 11–25%, у 35% — на 26–50%. Ещё 13% потратили на ИИ более чем на 50% сверх изначально рассчитанной суммы. У 2% опрошенных не было даже исходного прогноза, с которым можно сравнивать результат.
Цифры важны не сами по себе. Многие компании по-прежнему считают ИИ обычной программной лицензией: выбрали модель, прикинули стоимость токенов, умножили на число сотрудников — получили бюджет. На практике генеративная система ведёт себя иначе. Один запрос может потребовать нескольких итераций, повторных вызовов, проверки результата человеком и обращения к дополнительным инструментам. Если ответ ошибочен или неполон, компания оплачивает и неудачную попытку, и следующую.
В расчётах легко потерять не только токены. К прямым платежам поставщику модели добавляются интеграция с внутренними системами, хранение контекста и логов, защита данных, мониторинг качества, доработка промптов, работа инженеров и специалистов, которые проверяют ответы. Пока решение обкатывают на десятке пользователей, эти статьи выглядят терпимо. После подключения службы поддержки, продаж, аналитиков или разработчиков объём обращений меняется на порядок — и финансовая модель, собранная для пилота, перестаёт быть полезной.
Отдельная ловушка — выбор модели только по цене входного токена или подписки. CNews приводит результаты исследования учёных Стэнфорда, Беркли, Карнеги — Меллона и Калифорнийского университета, изучивших более 6800 задач по математике, программированию и другим направлениям. Вывод практичный: более дорогая модель способна оказаться дешевле по полной стоимости выполненной задачи, если решает её с меньшим числом шагов и без переделок.
В качестве иллюстрации авторы сопоставили Google Gemini 3.1 Pro и Gemini 3 Flash. Более производительная Gemini 3.1 Pro решила задачу за 85 шагов и обошлась в $1. Gemini 3 Flash потребовалось 1000 шагов; на неё ушло $14, однако корректного результата она не дала. Это не универсальный рейтинг моделей и не повод автоматически покупать самый дорогой вариант. Это пример того, почему расходы на ИИ нельзя оценивать только по прайс-листу: цена успешного результата важнее цены одного вызова API.
Для технических команд из этого следует довольно приземлённый набор правил. Нужно измерять стоимость не запроса, а бизнес-операции: обработанного обращения, подготовленного отчёта, проверенного фрагмента кода, успешно завершённого кейса. Полезно отдельно считать долю повторных запросов, число эскалаций к человеку, процент ошибок и стоимость исправления. Без таких метрик «дешёвая» модель может месяцами создавать видимость экономии, одновременно съедая бюджет на ручную проверку.
Не менее важен контроль маршрутизации. Простые, хорошо формализованные задачи можно направлять на более компактные модели, а сложные — на сильные. Но переключение должно опираться на тесты на реальных данных и понятные пороги качества, а не на интуицию закупщика или эффектную демонстрацию. Для задач с агентным сценарием стоит ограничивать число шагов, глубину вызовов инструментов и бюджет на один запуск: именно длинные цепочки рассуждений и повторных действий способны незаметно превратить мелкую операцию в дорогую.
Проблема в том, что даже у одной модели стоимость похожей работы может заметно меняться. CNews пересказывает сравнение с сервисом по стрижке газона: сегодня исполнитель делает работу за два часа, через неделю на ту же задачу уходит восемь, а затем он тратит пять часов и завершает только половину. Для ИИ это означает, что статичный тарифный калькулятор не заменит наблюдение за фактическим потреблением. Смету придётся пересматривать так же регулярно, как показатели доступности и качества сервиса.
При этом компании не спешат отказываться от нейросетей, несмотря на перерасход. Причина понятна: ИИ уже встроен в конкуренцию за скорость разработки, качество поддержки и производительность офисных процессов. Вопрос теперь не в том, использовать ли модели, а в том, кто первым научится связывать расходы на ИИ с измеримым результатом. Вероятно, следующий этап внедрения будет менее похож на эксперимент с подписками и больше — на дисциплину FinOps: с лимитами, наблюдаемостью, тестами качества и правом отключить сценарий, который не окупается.