AI И НЕЙРОСЕТИ

Nvidia продает не серверы, а токены: что обещает Vera Rubin

10-кратный рост токенов на ватт по сравнению с GB200 NVL72 обещает Nvidia для Vera Rubin. Разбираем, что это значит для AI-инфраструктуры.

✍️ Редакция iTech News | 22.07.2026 | ⏱ 5 мин | Источник: The Register

Nvidia показала, как собирается выжимать из AI-дата-центров больше денег на том же энергобюджете: платформа Vera Rubin, по заявлению компании, дает до 10 раз больше токенов на ватт по сравнению с GB200 NVL72 в первых тестах CoreWeave на DeepSeek-R1. Для русскоязычной IT-аудитории это важный сигнал: рынок AI-инфраструктуры окончательно перестает говорить только про «больше GPU» и все чаще считает выручку на один ватт, стойку и токен.

Nvidia устроила закрытый брифинг для журналистов в лаборатории в Саннивейле, где показала рабочую мини-версию дата-центра и новые железки для так называемых AI Factory, сообщает The Register. Смысл презентации был нарочито приземленный: AI-инфраструктура — это не абстрактные «модели в облаке», а вполне физические CPU, GPU, сетевые карты, коммутаторы, лотки, стойки, сборка и питание. Генеральный менеджер направления hyperscale и HPC Иэн Бак прямо сформулировал позицию компании: инфраструктуру можно потрогать, увидеть и именно она «оживляет» AI. Звучит как маркетинг, но в 2026 году это еще и попытка напомнить рынку, что главный дефицит в AI — уже не идеи, а мощность, энергия и скорость развертывания.

Главный герой презентации — платформа Vera Rubin, впервые анонсированная еще на Computex 2024 и подробнее раскрытая на CES в январе. В состав платформы входят шесть ключевых компонентов: CPU Vera, GPU Rubin, коммутатор NVLink 6, сетевой интерфейс ConnectX-9, DPU BlueField-4 и Ethernet-коммутатор Spectrum-6. Nvidia упаковывает это в несколько стоечных систем для дата-центров, включая вычислительный лоток Vera Rubin NVL72, лоток NVLink-переключателя для NVL72, лоток CPU Vera, лоток хранилища BlueField-4 STX и сетевой лоток Spectrum-6 SPX. Отдельно в списке упоминается inference-ускоритель Groq 3 LPX. Набор выглядит не как очередное обновление одной карты, а как попытка продать целую фабрику под AI-нагрузки, где вычисления, сеть, память и хранение проектируются как единая система.

Самая наглядная цифра с брифинга связана даже не с производительностью моделей, а со сборкой железа. Старший вице-президент по hardware engineering Эндрю Белл рассказал, что вычислительный лоток внутри Vera Rubin NVL72 при автоматизированной сборке можно собрать за одну минуту, тогда как для GB200 на ту же операцию обычно требуется 90 минут. Nvidia называет это улучшением в 90 раз. Для читателя, далекого от серверного цеха, цифра кажется декоративной. Для операторов дата-центров — нет. Если индустрия строит мощности в режиме непрерывной гонки, то выигрывает не только тот, у кого выше FLOPS, но и тот, кто быстрее собирает, везет, ставит и вводит стойки в строй. Иными словами, платформа Vera Rubin продается не только как вычислительная, но и как логистическая оптимизация.

Почему Nvidia так упирает именно в токены? Потому что под «агентный» AI компания теперь продвигает другую экономику инфраструктуры. По версии Nvidia, AI-агенты требуют не просто мощного железа, а устойчивого inference с низкой задержкой на множестве шагов рассуждения, высокой скорости декодирования, эффективной работы с длинным контекстом, крупного KV-кэша и масштабирования моделей на связанных доменах GPU. Отсюда и новый главный KPI: не просто производительность, а сколько прибыльных токенов можно выпустить в фиксированном по ваттам дата-центре. Бак сформулировал это максимально прямолинейно: инфраструктуру можно сдавать по часам, но реальная выручка AI Factory теперь считается токенами, которые она способна продать. Такой поворот хорошо объясняет, почему Nvidia все реже говорит языком классического enterprise-железа и все чаще — языком фабрики цифрового выпуска.

В этой логике CPU снова становится заметным персонажем, а не приложением к GPU. Nvidia делает ставку на то, что для агентных нагрузок важнее ускорять «ядро» системы, чем просто наращивать число ядер. Компания утверждает, что CPU Vera с ядром Olympus Core вдвое ускоряет агентов, дает втрое большую межъядерную пропускную способность и снижает задержку на 40 процентов за счет памяти LPDDR5X. Это уже важный нюанс для разработчиков и архитекторов платформ: в AI-сервисах следующей волны узким местом все чаще становятся оркестрация, перемещение данных, планирование, сеть и память, а не только чистое матричное умножение на GPU. Для продуктовых команд и CTO это неприятная, но полезная новость: бюджет на AI придется считать не только по картам, но и по всей системе, включая сеть, хранилище и стоимость ватта.

Есть, впрочем, и вторая сторона этой презентации, менее праздничная. Если все игроки на рынке одновременно повышают выпуск токенов, цена токена неизбежно идет вниз. Nvidia делает ставку на старую добрую логику масштаба: удешевление порождает спрос, спрос окупает капитальные затраты на новый бум строительства дата-центров. Но это работает только если клиенты действительно начинают потреблять больше inference. А тут уже не все так однозначно. The Register напоминает, что некоторые компании, по сообщениям с рынка, уже ограничивают сотрудникам бюджеты на токены. То есть обещанный рост производительности не везде превращается в очевидную экономику. Бак на брифинге попытался подкрепить тезис примером с разработчиками: в мире, по его оценке, 30-40 миллионов программистов, их совокупные зарплаты тянут примерно на 3 триллиона долларов, а если AI увеличивает их выпуск втрое, то получается эквивалент 9 триллионов долларов продуктивности. Но это скорее мысленный эксперимент, чем проверяемая метрика.

Тем не менее сама Nvidia, по словам Бака, уже живет в том будущем, которое продает рынку. В компании AI-агенты используются почти во всех процессах разработки софта, а также при проектировании чипов: всю базу багов по микросхемам, по его словам, просматривают и анализируют агенты. Это сильный маркетинговый ход: лидер AI-инфраструктуры говорит, что делает свои AI-железки и AI-софт с помощью того же AI. Но для отрасли тут важнее другое. Платформа Vera Rubin — это не просто новая линейка Nvidia, а очередной шаг к модели, где дата-центр оценивают как фабрику токенов, а не как набор серверов. Если этот подход закрепится, разработчикам, облачным провайдерам и корпоративным заказчикам придется привыкать к новой бухгалтерии: меньше разговоров про «модель сама по себе», больше — про токены на ватт, задержки между шагами агента и окупаемость стойки под реальную нагрузку.

Поделиться: Telegram X LinkedIn