AI И НЕЙРОСЕТИ

Nvidia раскрыла, как Rubin ускорит ИИ-инференс на уровне стойки

50 PFLOPS NVFP4 и 288 ГБ HBM4: Nvidia раскрыла, как архитектура Rubin ускоряет ИИ-инференс и снижает накладные расходы от GPU до стойки.

✍️ Редакция iTech News | 22.07.2026 | ⏱ 5 мин | Источник: Tom's Hardware
🌐

50 PFLOPS в режиме NVFP4 inference, 288 ГБ HBM4 и 22 ТБ/с пропускной способности памяти: Nvidia раскрыла новые детали про архитектуру Rubin, которая должна выйти осенью 2026 года в составе платформы Vera Rubin. Для тех, кто строит ИИ-сервисы, это важная история не про очередной рекорд в FLOPS, а про более приземленную вещь: как выжать больше токенов в секунду и меньше сжечь бюджета на инференс.

Как пишет Tom's Hardware, компания делает ставку на сдвиг рынка от гигантских обучающих прогонов к массовому агентному ИИ, где цена и скорость генерации токенов становятся главным KPI. В полной конфигурации Vera Rubin NVL72 речь идет о стойке с 36 CPU Vera и 72 GPU Rubin. Сам GPU собран из двух вычислительных кристаллов в одном корпусе через Nvidia High Bandwidth Interface, несет 224 SM, 896 Tensor Core и ту самую память HBM4 объемом 288 ГБ. Помимо заявленных 50 PFLOPS для разреженного NVFP4-инференса, Nvidia приводит и другие цифры: 35 PFLOPS в NVFP4 training, 17,5 PFLOPS в FP8/FP6 training, 250 TOPS в INT8, 4 PFLOPS в FP16/BF16, 2 PFLOPS в TF32, 130 TFLOPS в FP32 и 33 TFLOPS в FP64. Набор выглядит как напоминание рынку: Rubin собираются продавать не как узкоспециализированный ускоритель под одну метрику, а как платформу под широкий спектр AI-нагрузок.

Самое интересное в анонсе не сухая таблица производительности, а то, где именно Nvidia режет накладные расходы. Первый блок улучшений касается Tensor Memory Accelerator. На фоне роста MoE-моделей это не академическая мелочь, а вполне денежный вопрос. В Blackwell для каждого эксперта приходилось держать отдельные дескрипторы в памяти, и по мере роста числа экспертов росла цена их поиска и перемещения. В Rubin TMA теперь умеет работать с единым MoE-дескриптором, который ядра GPU поддерживают и обновляют прямо во время выполнения инструкции. Идея простая: меньше вычислений на метаданные и адресацию, больше времени дорогой кремний тратит на сам инференс. Для разработчиков, которые оптимизируют большие mixture-of-experts модели, это сигнал, что узким местом снова становится не только математика, но и оркестровка весов между GPU.

Второй большой блок улучшений касается самих Tensor Core. Nvidia удвоила объем работы, который ядра могут выполнять по K-измерению при матричных операциях. Если без математического шаманства, это уменьшает число итераций, нужных для перемножения матриц. Пример компании предельно прикладной: то, что на Blackwell требовало четырех проходов, на Rubin укладывается в два. Для инференса это полезно и на этапе обработки контекста, и на decode-фазе, где каждая лишняя задержка быстро превращается в заметный хвост по latency. Еще один апгрейд связан с softmax, одной из базовых операций в attention-механизме трансформеров. На Rubin ускорена работа Special Function Unit, и для BF16/FP16 экспоненциальных вычислений компания обещает рост пропускной способности в четыре раза относительно Blackwell. Для FP32 прирост скромнее: уровень Blackwell Ultra, то есть примерно двукратное ускорение против первого Blackwell GB200. На практике это важно для длинных контекстов, которые в продакшене уже давно перестали быть маркетинговой фантазией и подбираются к миллиону токенов.

Третий слой оптимизаций лежит между ядрами и между самими GPU. Внутри одного ускорителя архитектура Rubin тоньше управляет зависимостями между producer- и consumer-kernel. Если в Blackwell следующий kernel мог ждать завершения всей партии данных, то в Rubin он может стартовать по отдельным thread block сразу после готовности нужного куска. Перевод с языка презентаций на нормальный: лучше утилизация GPU, меньше пауз между ядрами, выше tokens per second на пользователя. На уровне стойки Nvidia отдельно взялась за NVLink-обмены. Поскольку веса модели, KV-cache и служебная синхронизация постоянно летают между ускорителями, накладные расходы на координацию начинают мешать не меньше, чем дефицит памяти. В Rubin CUDA-kernel могут напрямую инициировать меж-GPU-коммуникации через NCCL, а новый механизм counted writes убирает часть барьеров и atomic-операций на принимающей стороне. Чем меньше служебного трафика и ожиданий, тем ближе реальная производительность к красивым цифрам из слайдов.

Контекст здесь тоже важен. Nvidia все активнее продает не отдельные чипы, а законченные вычислительные стойки, где CPU, GPU, сетка NVLink и программная обвязка рассматриваются как один продукт. В этой логике архитектура Rubin нужна не просто для замены Blackwell по номеру поколения. Ее задача глубже: адаптировать железо под мир, где инференс становится непрерывным сервисом, агентные цепочки гоняют tool calling и кодовую генерацию, а считать надо не только пиковую производительность, но и стоимость каждого ответа. Поэтому в материале рядом с GPU-изменениями отдельно всплывает и CPU Vera с его высокой однопоточной производительностью для agent harnesses, tool calling и code compilation. Для бизнеса это звучит как обещание лучшей экономики на уровне стойки. Для инженерных команд это, скорее, напоминание, что оптимизировать придется весь стек сразу, а не надеяться, что новый GPU магически вылечит архитектурные долги приложения.

Главный вопрос теперь не в том, насколько эффектно архитектура Rubin выглядит на бумаге, а в том, сколько из этих оптимизаций доживет до реальных продакшен-нагрузок после прихода систем Vera Rubin осенью 2026 года. Если заявленное снижение накладных расходов на MoE, softmax и меж-GPU-синхронизацию подтвердится в бою, следующая гонка в ИИ пойдет уже не за самым большим кластером, а за самым дешевым токеном на стойке.

Поделиться: Telegram X LinkedIn