В ранних генеративных ИИ-кластерах на один CPU могло приходиться от четырех до восьми GPU, но с переходом к агентным системам этот баланс быстро меняется. Серверные процессоры внезапно вышли из тени ускорителей: для русскоязычной IT-аудитории это важный сигнал о том, что узким местом в AI-инфраструктуре становится уже не только Nvidia, но и вся логика вокруг CPU, памяти, сети и хранения.
Об этом сообщает Tom's Hardware: собеседники из Hitachi Vantara, PEAK:AIO, Aegis Cooling и OurPCB описывают один и тот же сдвиг. Если в эпоху чат-ботов основная ставка делалась на GPU для инференса, то ИИ-агенты требуют постоянной координации цепочек действий, вызовов инструментов, работы с внешними данными и предсказуемой задержки. Иными словами, модель может красиво рассуждать на GPU, но кто-то должен быстро подтянуть контекст, разрулить сеть, память, хранилище и оркестрацию. Этим и занимаются CPU.
В статье приводится показательная оценка AMD: раньше компания ожидала рост CPU-рынка примерно на 18% в год, а теперь говорит уже о 35% ежегодно и о потенциальном объеме рынка в 120 млрд долларов к концу десятилетия. Это не просто красивая презентационная дуга. По словам CTO Hitachi Vantara в регионе EMEA Джейсона Беккета, всегда включенные системы с многошаговым рассуждением не создают короткие всплески нагрузки вокруг GPU, а требуют процессоров с большим числом ядер, которые работают под устойчивой нагрузкой постоянно. Для дата-центра разница принципиальная: если раньше CPU можно было считать обслуживающим персоналом при звездах-GPU, то теперь без него весь агентный стек начинает спотыкаться о задержки.
Почему чат-боты и агенты требуют разной архитектуры
В случае классического чат-интерфейса небольшая пауза, пока модель «думает», часто считалась допустимой. Пользователь задает вопрос, система выдает ответ, и несколько лишних сотен миллисекунд не рушат сценарий. Агентный ИИ работает иначе. Он не просто генерирует текст, а последовательно вызывает инструменты, обращается к базам, ходит в API, сверяет промежуточные результаты и возвращает ответ уже после серии шагов. На каждом из этих этапов CPU участвует напрямую, поэтому задержка копится не в одном месте, а по всей цепочке.
Tom's Hardware ссылается и на анализ TrendForce: почти 91% совокупной задержки ответа в AI-развертываниях может приходиться именно на вклад CPU. Цифра выглядит как холодный душ для тех, кто привык измерять мощность ИИ-кластера числом ускорителей в стойке. Получается, что проблема уже не только в том, сколько терафлопс стоит в серверной, а в том, насколько быстро система умеет двигать данные между узлами, обслуживать память, сеть и хранение. Для разработчиков это довольно приземленный вывод: если агент тормозит, дело может быть не в модели и не в промпте, а в архитектуре исполнения.
На этом фоне меняется и сам язык проектирования дата-центров. В статье основатель OurPCB Хоммер Чжао формулирует мысль без лишней романтики: GPU очень быстрый, но сам по себе довольно «тупой» вычислительный двигатель. Он не общается с интернетом, не тянет данные с диска и не оркестрирует остальную систему. Поэтому гиперскейлеры все чаще отходят от схемы, где один хост-процессор более-менее условно прикручен к пачке GPU. Вместо этого они используют CPU с большим числом ядер, большим количеством каналов памяти, а иногда и несколько CPU на узел, чтобы не захлебнуться в потоке данных.
Что это меняет для рынка и команд
Сдвиг уже виден не только в разговорах аналитиков, но и в финансовых сигналах производителей. Tom's Hardware пишет, что сильный рост сегмента дата-центровых CPU поддерживает AMD, особенно за счет спроса гиперскейлеров на EPYC. Arm, в свою очередь, выигрывает от того, что крупнейшие облачные игроки все активнее делают собственные чипы под свои задачи. Беккет утверждает, что в 2025 году Arm обеспечивает почти половину всех вычислений, поставляемых ведущим гиперскейлерам, а количество развернутых ядер Neoverse уже превысило миллиард. За этими цифрами стоят не маркетинговые баннеры, а архитектурные решения, принятые несколько лет назад.
Отсюда и список имен, который теперь стоит читать внимательнее: AWS Graviton, Google Axion, Microsoft Cobalt. Все это признаки одного тренда. Облака все меньше хотят универсальное «железо на все случаи» и все больше строят специализированные платформы под конкретные роли в AI-системах: оркестрацию, предобработку данных, сетевой обмен, edge-инференс, работу с хранилищем. Для бизнеса это означает, что закупка ускорителей больше не выглядит самодостаточной стратегией. Если компания строит внутренний AI-контур, запускает RAG, автоматизацию через агентов или тяжелые пайплайны инференса, ей придется считать не только GPU-квоты, но и пропускную способность CPU-части, памяти и east-west traffic внутри кластера.
Есть и еще один практический эффект: серверные процессоры возвращаются в разговор о TCO. Чем плотнее AI-стойка, тем заметнее вопросы питания и охлаждения. По данным Tom's Hardware, в жидкостно охлаждаемых конфигурациях CPU все чаще рассматривают уже в том же тепловом контуре, что и GPU, а не как что-то второстепенное, что можно оставить на воздухе. Для IT-директоров и инфраструктурных команд это плохая новость лишь в одном смысле: простой закупкой «побольше ускорителей» уже не отделаться. Хорошая же новость в том, что именно здесь появляется пространство для оптимизации архитектуры, а не только бюджета.
Главный вопрос теперь не в том, хватит ли рынку GPU, а в том, кто быстрее пересоберет AI-стойку под новую реальность, где серверные процессоры снова стали критичным ресурсом. Если агентный ИИ действительно станет базовым интерфейсом для корпоративного софта, выигрывать будут не те, кто собрал больше ускорителей, а те, кто точнее настроил соотношение CPU, GPU, памяти, сети и охлаждения.