AI И НЕЙРОСЕТИ

AI-агенты уже съедают в 5 раз больше токенов, чем люди

7,3 трлн токенов за август пришлись на AI-агентов в OpenRouter против 1,4 трлн у людей. Главная нагрузка — cached prompts.

✍️ Редакция iTech News | 04.10.2026 | ⏱ 4 мин | Источник: Tom's Hardware
🔮

AI-агенты уже генерируют в OpenRouter примерно в пять раз больше токенов, чем люди: 7,3 трлн против 1,4 трлн за август. Для IT-команд это не просто красивая метрика из мира AI-хайпа, а сигнал о будущих счетах за инфраструктуру, памяти GPU и архитектуре продуктов, где один человеческий запрос запускает десятки машинных итераций.

Об этом сообщает Tom's Hardware со ссылкой на пост CEO Futurum Group Дэниела Ньюмана и график Andreessen Horowitz по данным OpenRouter. Ньюман написал 30 сентября 2026 года, что «AI сейчас используется AI в 5 раз чаще, чем людьми», и спрогнозировал рост до 10x и выше. Формулировка звучит эффектно, но за ней есть конкретная механика: агентные системы много раз возвращаются к уже известному контексту, таскают историю диалога, результаты инструментов и промежуточные шаги.

OpenRouter, платформа маршрутизации запросов к AI-моделям, делит API-ключи на три категории: agentic, mixed и human. Классификация строится не по названию приложения, а по составному скорингу из семи сигналов, включая частоту вызовов инструментов, число ходов в сессии и паузы между ними. По графику главы аналитики OpenRouter Питера Уокера, перелом произошел еще в феврале: с этого момента агентный трафик обогнал человеческий.

С тех пор разрыв стал резко шире. Использование токенов агентами выросло в 14 раз, человеческое — в 2,8 раза. Категория mixed, где, вероятно, сидят сценарии с участием и пользователя, и автономной логики, выросла примерно в 4,7 раза. Поэтому точное соотношение зависит от того, какую часть смешанного трафика считать агентной, но общий тренд уже трудно списать на статистический шум.

Важная оговорка: речь идет о токенах, а не о деньгах. Более 85% агентных токенов, по данным a16z со ссылкой на OpenRouter, приходятся на cached prompts — повторное чтение уже обработанного контекста. Такие токены обычно дешевле, чем первичная обработка нового промпта, но они не бесплатны для железа. Контекст нужно держать в памяти, а для длинных цепочек рассуждений и инструментальных вызовов это становится отдельной нагрузкой.

Здесь начинается менее глянцевая часть истории. Внутри моделей этот сохраненный контекст живет в KV cache, и именно он начинает упираться в емкость HBM на GPU. Tom's Hardware приводит похожий пример из практики консалтинговой компании для колл-центров, тестировавшей DeepSeek на арендованных Nvidia H200: в сентябрьских логах ее агентов при работе с Claude Code 96% входных токенов были повторным чтением старого разговора. Иными словами, агент может выглядеть занятым, хотя значительную часть времени он перечитывает собственные заметки.

Для разработчиков это хороший повод пересмотреть дизайн агентных пайплайнов. Чем длиннее история, чем больше tool calls и чем хуже обрезается контекст, тем быстрее растет не только счет за inference, но и скрытая цена памяти. Командам, которые строят AI-ассистентов для поддержки, разработки, продаж или внутренних операций, придется внимательнее относиться к summarization, retrieval, очистке контекста и хранению состояния вне промпта. Просто складывать весь диалог обратно в модель — удобный, но дорогой путь.

Для бизнеса вывод тоже неприятно практичный. ROI от AI часто считают по числу сотрудников, которые начали пользоваться ассистентом, или по числу закрытых задач. Но если один пользовательский сценарий запускает несколько автономных агентов, а каждый агент много раз перечитывает историю, реальная инфраструктурная нагрузка растет быстрее adoption-метрик. McKinsey в своем State of AI 2026 пишет, что 40% респондентов из крупных организаций уже масштабируют AI-агентов, годом ранее таких было 27%. Масштабирование здесь означает не только новые workflow, но и новый спрос на память.

Этот спрос накладывается на уже напряженный рынок компонентов. Micron ожидает ухудшения дефицита RAM и storage в 2027 и 2028 годах, а производители памяти приоритизируют HBM для AI-дата-центров. Если прогноз Ньюмана о росте с 5x до 10x, 20x и 30x окажется хотя бы частично верным, за память будут конкурировать не только облака, игровые ПК и корпоративные серверы. В очереди появятся еще и армии агентов, занятых, в основном, чтением того, что они уже видели.

Поделиться: Telegram X LinkedIn