AI И НЕЙРОСЕТИ

Борьба за токены: как компании режут расходы на корпоративный ИИ

4,2% AI-leverage hours при 0,7% токенов: новый класс AI FinOps-инструментов обещает остановить tokenmaxxing и вернуть контроль над бюджетами.

✍️ Редакция iTech News | 28.05.2026 | ⏱ 5 мин | Источник: The New Stack
🔬

Один из бета-клиентов Lanai смог делегировать 4,2% всех AI-leverage hours в компании, потратив на это лишь 0,7% токенов. На фоне корпоративной гонки за генеративным ИИ это звучит как неприятный, но полезный диагноз: расход токенов давно перестал быть безобидной метрикой активности и все чаще превращается в отдельную статью расходов, которую уже нельзя прятать внутри общего облачного счета.

Об этом сообщает The New Stack в материале о новом сервисе Token Tuner от Lanai. Компания называет проблему tokenmaxxing: когда бизнес начинает считать, что чем больше токенов сжигают сотрудники и агенты, тем выше продуктивность. На практике логика быстро ломается. Если инженер, аналитик или отдел поддержки гоняет дорогую модель там, где хватило бы более дешевой, счет растет заметно быстрее, чем реальная польза для продукта или бизнеса.

Токены как новая утечка бюджета

Lanai описывает Token Tuner как инструмент, который связывает затраты на ИИ с конкретными рабочими сценариями, выбором модели, эффективностью и итоговой ценностью. Идея довольно приземленная: не просто видеть счет от вендора, а понимать, кто, где и зачем потратил токены. Сервис оценивает взаимодействия с ИИ на уровне сессий, промптов и вызовов инструментов, а затем пытается соотнести их со сложностью задачи и ожидаемым выигрышем в производительности. На выходе компания показывает не только затраты, но и условный productivity score: насколько адекватно человек или команда подобрали модель под задачу.

Пример из статьи нарочито бытовой, но показательный. Если сотрудник использует условно «тяжелую» модель уровня Opus 4.7 для ответов на электронные письма, его эффективность будет ниже, чем у коллеги, который делает ту же работу на меньшей модели. Это и есть нерв всей истории: корпоративный ИИ быстро вошел в повседневные процессы, но привычка выбирать модель по принципу «самая мощная значит лучшая» бьет по бюджету почти так же предсказуемо, как когда-то бесконтрольное разрастание облачных инстансов.

Почему тема вообще вышла на уровень новостного повода? Потому что кейсы перестали быть теоретическими. The New Stack напоминает недавнюю историю Uber. В прошлом месяце CTO компании Неппалли Нага рассказал The Information, что бюджет, который он ожидал на использование Anthropic Claude Code, уже оказался недостаточным. Спустя несколько недель COO Uber Эндрю Макдональд в интервью Rapid Response, о котором первым написал Business Insider, признал, что внутри компании это вызвало почти паническую реакцию. По его словам, инженерной организации придется всерьез обсуждать потребление токенов, связанные с ним расходы и компромиссы по отношению к найму. Это уже не разговор про «интересный пилот», а обычная управленческая арифметика.

Сооснователь и CEO Lanai Лекси Риз в статье формулирует проблему без эвфемизмов: tokenmaxxing реален, дорог и выходит далеко за пределы нескольких команд или отдельных компаний. За этим тезисом стоит не только счет за inference. Чем больше в организации агентных сценариев, автоматических цепочек и полуавтономных ИИ-функций, тем выше риск раздутого кода, сползающей архитектуры и слабой видимости в том, что вообще происходит внутри системы. Иначе говоря, расход токенов — это уже не просто про деньги, а еще и про управляемость.

От tokenmaxxing к outcomemaxxing

Lanai предлагает заменить культ токенов культом результата и использует для этого термин outcomemaxxing. Смысл менее мемный, чем словообразование, зато для CIO и VP of Engineering вполне понятный: считать не объем потребления модели, а полезный выход. В бета-режиме, пишет The New Stack, один из пользователей Token Tuner делегировал те самые 4,2% AI-leverage hours, используя лишь 0,7% токенов, и получил efficiency score 6,0. На этом фоне другие сотрудники, по данным компании, сжигали в десять раз больше токенов при вдвое меньшей эффективности. Для рынка это сильный сигнал: даже внутри одной организации разброс по качеству использования LLM может быть огромным, а значит оптимизация лежит не где-то в лаборатории, а буквально на расстоянии одного отчета.

Chief Product Officer Lanai Мохит Мехта утверждает, что система умеет считать продуктивность даже в сценариях, где один workflow проходит сразу через несколько моделей. Это важный момент для крупных компаний, у которых стек ИИ обычно неоднородный: где-то используется один провайдер, где-то другой, а поверх них еще навешаны внутренние агенты, поиск, инструменты и прикладные сервисы. По словам Мехты, сервису не нужна кастомная инструментализация: Lanai агрегирует промпты и связанную активность инструментов внутри сессии, а затем собственными моделями определяет тип задачи, ее сложность и вероятный прирост продуктивности. На бумаге это выглядит как попытка перевести AI FinOps из уровня «вот вам invoice» на уровень «вот вам стоимость конкретного бизнес-намерения».

Отдельно интересен подход к рекомендациям по удешевлению моделей. Вместо синтетических бенчмарков Lanai, по словам Мехты, опирается на наблюдаемую outcome data, то есть на реальные результаты пользователей внутри компании. Проще говоря, система не обещает абстрактно, что более дешевая модель «должна справиться», а показывает, что похожая команда уже выполняла ту же задачу на более дешевом варианте без потери качества. Для корпоративного заказчика это куда убедительнее любых демонстраций на эталонных тестах, которые в реальной работе нередко рассыпаются при первом же нестандартном кейсе.

Для разработчиков и руководителей здесь несколько очевидных выводов. Во-первых, эпоха, когда использование ИИ можно было мерить числом запросов и радоваться росту графика, заканчивается. Во-вторых, AI-стек придется нормировать так же жестко, как инфраструктуру, SaaS-подписки и cloud spend. В-третьих, победят не обязательно те, кто даст сотрудникам самую дорогую модель по умолчанию, а те, кто научится подбирать модель под задачу и доказывать, что автоматизация действительно ускоряет релизы, поддержку, аналитику или продажи. В противном случае генеративный ИИ рискует повторить старую корпоративную историю: сначала все восхищаются скоростью внедрения, а потом финдиректор приходит за ответом, почему счет растет быстрее выручки.

Если рынок действительно двигается от tokenmaxxing к outcomemaxxing, то следующим полем конкуренции станет не качество очередной демо-модели, а качество учета: кто лучше свяжет промпт, рабочий процесс, цену и результат. И в этой логике вопрос уже не в том, могут ли компании позволить себе больше ИИ, а в том, смогут ли они доказать ценность каждого лишнего токена. Подробности исходного материала — в The New Stack.

Поделиться: Telegram X LinkedIn