Экономика ИИ уперлась не только в цену токена: когда корпоративные ассистенты, RAG-системы и агенты выходят из пилотов в продакшен, переменный счет за облако становится отдельным управленческим риском. По данным MIT Technology Review, доля компаний, у которых не менее 40% AI-проектов находятся в продакшене, может удвоиться в течение шести месяцев. Для IT-директоров и продуктовых команд это означает неприятный, но полезный вопрос: пора ли считать не запросы к модели, а загрузку собственной или выделенной мощности?
Поводом стала опубликованная MIT Technology Review спонсорская колонка HPE о том, как бизнесу перестать воспринимать ИИ только как операционный расход. Тезис простой: пока команда экспериментирует, потребление по запросу удобно. Купили доступ к модели, проверили гипотезу, отключили. Но когда AI-сервисы становятся частью клиентской поддержки, внутренних IT-процессов, поиска по базе знаний или аналитических цепочек, счетчик начинает крутиться постоянно.
До сих пор разговор о расходах на ИИ часто начинался с цены входных и выходных токенов и быстро сводился к доступу к самой новой облачной модели. Но не каждой задаче нужен максимальный класс модели. Простому ассистенту, поиску по документации и многошаговому агенту нужны разные уровни качества, задержки, контекста и стоимости. Один сценарий тратит немного токенов на короткий ответ, другой прогоняет через модель большие фрагменты корпоративных данных, третий делает несколько вызовов модели, ходит в инструменты и повторяет рассуждение по шагам.
Именно здесь экономика ИИ перестает быть красивой строкой в презентации. RAG-система может оказаться дороже обычного чат-бота не из-за модели, а из-за объема контекста, который приходится подмешивать в каждый запрос. Агентный процесс может стоить еще иначе: одна бизнес-задача превращается в цепочку из поиска, планирования, вызова API, проверки результата и нового вызова модели. Универсальный бенчмарк тут помогает примерно как средняя температура по дата-центру: любопытно, но бюджет не защитит.
HPE предлагает смотреть на вопрос как на расчет точки перехода. Пока спрос неровный и непредсказуемый, облачное потребление дает гибкость и не требует капитальных вложений. Если же нагрузка стала стабильной, достаточно крупной и повторяемой, компании стоит посчитать, не выгоднее ли инвестировать в выделенную мощность, которую можно контролировать и оптимизировать. Это не спор «облако против своего железа» из старых форумных войн. Это решение по конкретным workload: сколько задач будет работать ближайшие 12–18 месяцев, насколько равномерно они загрузят инфраструктуру, можно ли разделить одну платформу между несколькими командами.
Важная оговорка: владение мощностью само по себе ничего не экономит. Если GPU простаивают, платформа превращается в дорогой памятник энтузиазму совета директоров. Чтобы инвестиция работала, нужны не только серверы, но и операционная дисциплина: быстрый вывод сценариев в продакшен, контроль использования, правила доступа, мониторинг загрузки, регулярный поиск новых задач, которые можно посадить на ту же инфраструктуру. Без этого компания покупает не актив, а еще один способ объяснять финансовому директору, почему инновации опять вышли дороже плана.
Для разработчиков это означает более прагматичный подход к архитектуре AI-продуктов. Модель больше нельзя выбирать только по качеству на демо. Придется учитывать длину контекста, частоту вызовов, повторные обращения агента, кэширование, маршрутизацию между моделями, стоимость инференса и требования к задержке. Для бизнеса вопрос еще жестче: какие AI-сценарии реально дают возврат, а какие просто красиво выглядят в квартальном отчете. Экономика ИИ будет все чаще считаться на уровне портфеля задач, а не отдельного чат-бота.
Самый практичный вывод из этой истории — перестать обсуждать ИИ как бесконечную подписку на чужую модель. Следующий этап корпоративного внедрения будет строиться вокруг загрузки, предсказуемости и способности превращать вычислительную мощность в измеримый результат. Компании, которые научатся считать эту математику заранее, получат управляемую инфраструктуру; остальные продолжат удивляться счетам за «маленький внутренний ассистент», который внезапно стал критичным сервисом.