AI И НЕЙРОСЕТИ

Nvidia показала, зачем ей Groq: до 3400 токенов в секунду

3400 токенов в секунду на Gemma 4 31B: Nvidia раскрыла первые результаты Groq 3 и показала, как хочет ускорить ИИ-агентов.

✍️ Редакция iTech News | 25.08.2026 | ⏱ 5 мин | Источник: The Register
🎓

Ускорители Nvidia Groq впервые показали публичный результат, ради которого Nvidia и пошла на свою ставку в $20 млрд: до 3400 токенов в секунду на модели Gemma 4 31B при входной последовательности в 100 тысяч токенов. Для разработчиков и команд, которые строят ИИ-агентов, это не про красивую цифру на слайде, а про вполне прикладной вопрос: сколько рассуждений, шагов и контекста модель успеет обработать, пока пользователь не закроет вкладку.

О результатах, со ссылкой на независимый бенчмарк Artificial Analysis, сообщает The Register. Речь идет о стойках LPX на базе Groq 3 LPU, которые, по данным Nvidia, оказались примерно в четыре раза быстрее ближайшей альтернативы в том же тесте. Судя по таблице Artificial Analysis, укол адресован прежде всего Cerebras: ее платформа показала 882 токена в секунду при тех же условиях. На бумаге разрыв выглядит внушительно. Но, как обычно в железе для ИИ, дьявол живет не в пресс-релизе, а в архитектуре, размере модели и числе чипов, необходимых для такого результата.

Главная особенность Groq 3 LPU в том, что это не классический GPU-подход с опорой на HBM или GDDR, а SRAM-тяжелая dataflow-архитектура, заточенная под инференс. Nvidia говорит о пропускной способности памяти в 150 ТБ/с у чипов третьего поколения. Для стадии декодирования в LLM это ключевой параметр: именно память, а не чистые FLOPS, часто оказывается узким местом. Проблема в другом: SRAM занимает слишком много площади на кристалле, поэтому емкость у таких ускорителей скромная. Если у топового Rubin GPU на борту 288 ГБ памяти, то у одного Groq 3 LPU только 500 МБ. Разница почти карикатурная, но это и есть цена за экстремальную скорость доступа.

Из-за этого модель Gemma 4 31B нельзя просто положить на один такой ускоритель и наслаждаться жизнью. Nvidia распределяет веса между несколькими LPU по Ethernet. В одной стойке LPX может быть до 256 ускорителей, что дает суммарно 128 ГБ SRAM. Для Gemma 4 31B этого хватает с запасом: в FP8 модель требует чуть больше 31 ГБ, то есть менее 64 LPU. The Register предполагает, что Nvidia использует обычный pipeline parallelism, а при высокой конкуренции добавляет data parallelism, фактически дублируя конвейер. Это не экзотика, а инженерная необходимость: слишком маленькая локальная память заставляет масштабироваться не внутри одного большого чипа, а через множество маленьких.

Здесь начинается самое интересное. Gemma 4 31B удобна для демонстрации, потому что это почти идеальный сценарий для таких ускорителей. Модель достаточно крупная, чтобы результат выглядел серьезно, но все еще помещается в одну стойку LPX. При этом она dense, то есть при генерации каждого токена активируются все 31 млрд параметров. Для теста пропускной способности это важный плюс. Но как только речь зайдет о более тяжелых MoE-моделях, картина может стать менее нарядной. The Register приводит показательный ориентир: у DeepSeek V3 заявлено 671 млрд параметров, из которых активны 37 млрд. По числу активных параметров это не так уж далеко от 31B dense-модели, но сама природа MoE добавляет накладные расходы, потому что для разных токенов активируются разные части сети. А чтобы развернуть такую модель на LPX, понадобится 1342 ускорителя, то есть больше пяти стоек. Красиво на графике, заметно сложнее в эксплуатации.

Собственно, Nvidia и не делает вид, что LPX должен жить в одиночку. Ее реальная ставка не в том, что LPU заменит GPU, а в том, что они будут работать в связке. Компания делит инференс на две фазы: вычислительно тяжелый prefill, где нужно прогнать длинный промпт и сформировать KV-cache, остается на GPU; чувствительный к пропускной способности decode переносится на LPU. Для корпоративных команд это, пожалуй, самый важный вывод из всей истории. Nvidia продает не очередной «самый быстрый чип в мире», а гетерогенную архитектуру для эпохи агентных систем, где важна не только общая производительность, но и интерактивность на одного пользователя. Чем быстрее летят токены, тем больше агент успевает за тот же интервал: дольше рассуждать, чаще обращаться к инструментам, проверять больше контекста и в целом выглядеть менее декоративно.

Рынок, похоже, идею услышал. Nvidia уже назвала одного из первых клиентов для таких конфигураций: нидерландский neocloud-провайдер Nebius собирается поставить комбинированные системы у себя в дата-центрах. Это хороший индикатор того, куда движется инфраструктура: не только гиперскейлеры, но и облачные игроки второго эшелона начинают охотиться за архитектурами, которые могут предложить premium-класс инференса для агентных сценариев. Для российских команд, строящих собственные copilot-сервисы, ИИ-поиск, автоматизацию саппорта или внутренние агентные платформы, вывод простой: гонка теперь идет не только за размером модели, но и за скоростью декодирования под длинный контекст.

При этом цифру «в четыре раза быстрее Cerebras» стоит читать с инженерным скепсисом, а не маркетинговым восторгом. Nvidia сравнивает результат на конкретной длине промпта и не слишком акцентирует, сколько именно ускорителей требуется для этой победы. По оценке The Register, Gemma 4 31B у Cerebras должна помещаться в один, максимум два 44-гигабайтных CS-3. У Nvidia для того же класса задачи может понадобиться не меньше 64 LPU. Да, это разные архитектуры и разные способы считать эффективность, но в закупках считают не только токены в секунду, а еще стойки, сеть, питание, отказоустойчивость и сложность оркестрации. Добавим к этому еще один нюанс: показатели Cerebras относятся не к самому новому поколению. Компания уже анонсировала CS-4 на базе WSE-3T с удвоением вычислений, пропускной способности памяти, I/O и fabric, плюс с утроенным числом ускорителей в стойке. Если эти системы выйдут в облако до конца года, нынешняя красивая таблица Nvidia может довольно быстро потерять блеск.

Именно поэтому история с ускорителями Nvidia Groq важна не как финальный ответ, а как смена правил игры. В сегменте ИИ-инференса побеждает уже не тот, у кого просто самый большой и дорогой чип, а тот, кто лучше разложит нагрузку между памятью, сетью и вычислением. Для бизнеса это означает рост интереса к специализированным стойкам под агентные нагрузки. Для разработчиков — новый уровень зависимости производительности продукта от того, где именно крутится decode. А для всей отрасли — очень конкретный вопрос: сможет ли Nvidia превратить впечатляющий best-case-бенчмарк в устойчивое преимущество на реальных, грязных, многопользовательских нагрузках, где модели больше, контекст длиннее, а красивые цифры обычно заканчиваются раньше бюджета.

Поделиться: Telegram X LinkedIn