McKinsey расходовала около 5 трлн токенов в месяц на ИИ-инструменты и решила бороться с лишними затратами не запретами, а письмами сотрудникам. Такой подход к проблеме перерасхода ИИ-токенов важен не только для консалтинга: любая компания, которая массово внедряет нейросети, рано или поздно обнаружит, что счет за эксперименты умеет расти быстрее пользы.
По данным Habr / Новости, руководитель британского подразделения McKinsey по ИИ и аналитике QuantumBlack Дебасиш Патнайк рассказал о системе учета потребления токенов на уровне каждого пользователя. Летом компания запустила уведомления: если сотрудник начинает потреблять слишком много ИИ-ресурсов, ему приходит письмо с пояснением, как выполнить задачу дешевле для компании. Логика похожа на корпоративный контроль мобильного трафика: не отобрать телефон, а показать, где человек случайно стримит видео в роуминге.
Ключевая цифра здесь даже не общий месячный расход, а распределение нагрузки. В McKinsey около 10% сотрудников создают примерно 65% потребления ИИ-токенов. Активнее всего, по словам Патнайка, нейросетями пользуются консультанты и инженеры. Это ожидаемая пара: одни постоянно собирают, переписывают и проверяют материалы для клиентов, другие гоняют код, тесты, прототипы и документацию через модели. В обоих случаях ИИ быстро превращается из игрушки в рабочий станок, а станок потребляет электричество, только счет приходит в токенах.
Важно, что McKinsey не начала с жестких лимитов. Компания делает ставку на видимость расходов: сотрудник получает наглядную статистику и начинает иначе формулировать запросы, меньше гонять огромные контексты, аккуратнее повторять однотипные операции. Это звучит скучнее, чем запретить все лишнее через админку, зато ближе к реальности. Если бизнес уже подсадил команды на ИИ-инструменты, резкое закручивание гаек ударит по тем же процессам, ради которых эти инструменты внедряли.
Одними письмами дело не ограничилось. McKinsey использует внутренний ИИ-шлюз, который оптимизирует запросы перед отправкой в модели. Есть автоматические предохранители: при аномальных скачках расхода доступ могут временно приостановить, чтобы проверить, что происходит. Еще один слой — кэширование типовых ответов, чтобы компания не платила заново за одинаковые или близкие запросы. Для IT-команд это знакомая архитектурная история: наблюдаемость, rate limiting, middleware, кэш. Просто теперь такие паттерны переехали из API и баз данных в корпоративное использование генеративного ИИ.
Показательно, что McKinsey уже продает этот опыт клиентам. Рекомендация Патнайка: считать стоимость токенов не на одного сотрудника, а относительно результата. Иными словами, дорогой промпт может быть нормальным, если он экономит часы работы консультанта, разработчика или аналитика. Дешевый промпт тоже может быть мусором, если запускается сотни раз без пользы. Для CIO и финансовых директоров это неприятная, но полезная мысль: бюджет на ИИ нельзя оценивать как подписку на офисный софт. Он ближе к облачной инфраструктуре, где стоимость зависит от поведения пользователей и качества инженерной обвязки.
На фоне этого особенно ярко выглядят истории о крайностях. Финтех-стартап Slash из Сан-Франциско рассказывал, что один сотрудник потратил токенов на $81 тыс. после призыва руководства активнее использовать нейросети. Проблема была не в рабочей автоматизации: ресурсы ушли на разработку веб-шутера. Разработчик-блогер OrcDev, в свою очередь, сообщил, что за месяц обработал 235 млрд токенов, которые при оплате по API-тарифам стоили бы $157 143,39, но фактически обошлись ему в $400 за две подписки: Codex и Claude по $200 каждая. Эти примеры не стоит механически переносить на каждую компанию, но они хорошо показывают разрыв между тарифной моделью, пользовательским поведением и реальной себестоимостью ИИ-работы.
Для русскоязычных IT-команд главный вывод практичный: перерасход ИИ-токенов — это не будущая проблема зрелых корпораций, а ближайшая бухгалтерская реальность для всех, кто раздает доступ к моделям отделам разработки, аналитики, продаж или поддержки. Нужны не только политики использования, но и технический слой: шлюз, логирование, разметка задач, кэширование, алерты, понятные дашборды для пользователей и менеджеров. Без этого компания видит только итоговый счет и начинает лечить симптом самым грубым способом — лимитами.
Похоже, следующий этап внедрения ИИ в бизнесе будет менее романтичным: меньше разговоров о магии промптов, больше FinOps, внутренних тарифов и обучения сотрудников экономной работе с контекстом. Компании, которые научатся связывать токены с результатом, получат управляемый инструмент. Остальные рискуют однажды обнаружить, что их стратегия ИИ свелась к дорогому генератору черновиков и очень бодрому счетчику расходов.