АНАЛИТИКА

SambaNova показала, как оживить старые GPU для AI-инференса

763 токена в секунду на MiniMax M2.7: SambaNova показала, как связка H200 и SN50 ускоряет AI-инференс и продлевает жизнь GPU-паркам.

✍️ Редакция iTech News | 09.07.2026 | ⏱ 4 мин | Источник: The Register
📐

Старые GPU в датацентре еще рано списывать в музей железа. SambaNova показала, что AI-инференс на GPU можно заметно ускорить, если оставить видеокартам тяжелую подготовку запроса, а генерацию токенов отдать специализированным ускорителям: в тесте MiniMax M2.7 такая связка выдала 763 токена в секунду. Для русскоязычных команд, которые считают экономику LLM-сервисов не в презентациях, а в стойках, киловаттах и цене токена, это вполне практичный сигнал.

Речь идет о результатах стороннего тестирования, о которых сообщает The Register. По данным издания, бенчмарк провела Artificial Analysis: платформа SambaNova, где вместе работали четыре Nvidia H200 и 16 ускорителей SN50 RDU, показала 763 токена в секунду на коротком контексте в 10 тысяч входных токенов при работе с MiniMax M2.7. На длинных контекстах компания заявляет скорость выше 450 токенов в секунду. На фоне обычных GPU-only конфигураций это уже не косметическая прибавка, а аргумент для архитектурного пересмотра.

Ключевая идея проста и от этого особенно неприятна для любителей решать все одной дорогой видеокартой. Инференс LLM разбивается на две разные по характеру нагрузки фазы. В фазе prefill модель обрабатывает запрос, строит внутренние представления и кеши; эта часть вычислительно тяжелая, и ее оставили H200. В фазе decode модель уже порождает выходные токены; здесь узким местом чаще становится не чистая вычислительная мощность, а память и пропускная способность. Эту работу SambaNova отдала своей стойке из 16 SN50. Получился AI-инференс на GPU, где GPU больше не обязаны тянуть весь конвейер в одиночку.

Для рынка это важный сдвиг не только из-за красивой цифры в бенчмарке. Разделение prefill и decode за последний год стало одним из главных приемов в борьбе за дешевый токен, особенно в сценариях с длинными сессиями и агентами, которые живут дольше одного запроса. Кодовые ассистенты, корпоративные чат-боты, анализ документов, автоматизация поддержки, все это упирается не только в то, как быстро модель стартует, но и в то, сколько стоит удерживать высокую скорость генерации на длинной дистанции. Именно здесь специализированные ускорители пытаются откусить кусок рынка у универсальных GPU.

Nvidia, по сути, сама открыла дверь для такого подхода, когда начала показывать конфигурации с разным соотношением ресурсов под prefill и decode в системах NVL72. Позже компания пошла дальше и показала более разнесенный по ролям подход с LPX-стойками на базе Groq, представленными на весенней GTC. После этого в гонку включились почти все: AMD, AWS, Cerebras и другие игроки стали предлагать собственные варианты disaggregated или heterogeneous inference. На этом фоне SambaNova пытается зайти с понятным тезисом: если у вас уже есть парк Nvidia, не обязательно выбрасывать его ради следующей волны ускорителей, можно пристроить к нему специализированный decode-слой и выжать из существующей инфраструктуры больше.

Этот тезис особенно интересен тем, кто смотрит не только на производительность, но и на внедрение. SambaNova отдельно подчеркивает, что ее системы охлаждаются воздухом и могут ставиться в существующие датацентры. Это важная деталь: далеко не каждая площадка готова внезапно полюбить жидкостное охлаждение, а у новых поколений ускорителей требования к инфраструктуре становятся все жестче. Если обещания компании подтвердятся в реальных продакшн-нагрузках, то у многих операторов появится неприятно рациональный вопрос: зачем переплачивать за тотальную замену железа, если AI-инференс на GPU можно перестроить по модульному принципу.

Есть и другой слой новости, уже скорее финансовый. За месяц до публикации результатов SambaNova и Intel объявили, что одной из первых компаний, которая развернет комбинированное предложение GPU плюс RDU, станет Vector Core Compute, а TogetherAI назвали первым крупным заказчиком такого масштаба. А 8 июля 2026 года SambaNova закрыла первый транш раунда Series F на $1 млрд под руководством General Atlantic. Оценка стартапа при этом составила $11 млрд. Для рынка AI-железа это не просто красивый пресс-релиз, а сигнал, что инвесторы по-прежнему готовы ставить крупные суммы не только на производителей GPU, но и на тех, кто обещает улучшить экономику уже установленных парков.

Для разработчиков и продуктовых команд из этой истории следует вполне земной вывод. Побеждает уже не тот, кто просто купил побольше ускорителей, а тот, кто лучше разложил пайплайн по типам нагрузки. Если в вашем сервисе длинные диалоги, агентные цепочки, генерация кода или массивная работа с контекстом, то вопрос стоит не только в выборе модели, но и в том, где у вас узкое место: вычисления, память, сеть, стоимость стойки, охлаждение или задержка на токен. На этом фоне разговор про AI-инференс на GPU быстро перестает быть спором фанатов брендов и становится задачей для архитекторов платформы и финансистов.

Теперь главный вопрос не в том, можно ли ускорить инференс гибридной схемой, а в том, насколько воспроизводимы эти цифры на других моделях, контекстах и при высокой многопользовательской нагрузке. SambaNova уже обещает показать более мощные конфигурации на 128 и затем на 256 ускорителях. Если там удастся удержать скорость генерации без взрывного роста стоимости токена, рынок AI-инфраструктуры получит еще один неприятный для GPU-монокультуры урок: иногда лучший апгрейд для старого парка Nvidia — не новая Nvidia, а сосед по стойке.

Поделиться: Telegram X LinkedIn