AI И НЕЙРОСЕТИ

Google и NVIDIA представили DiffusionGemma — 1000 токенов/сек на H100

Новая модель Google DiffusionGemma достигла скорости генерации текста 1000 токенов в секунду на NVIDIA H100.

✍️ Редакция iTech News | 16.11.2025 | ⏱ 2 мин | Источник: NVIDIA Developer Blog
DiffusionGemma от Google: 1000 токенов в секунду на H100

Google совместно с NVIDIA выпустила модель DiffusionGemma, которая генерирует до 1000 токенов в секунду на платформе NVIDIA H100. Это новшество позволит значительно ускорить разработку AI-приложений, таких как чат-ассистенты и копилоты, благодаря параллельной генерации текстов.

Преимущества DiffusionGemma

С помощью DiffusionGemma разработчики смогут генерировать tekstовые токены более эффективно. Модель использует диффузионное подавление шума, чтобы одновременно создавать 256 токенов за шаг. Это позволяет достичь скорости генерации на уровне 150 токенов/сек на NVIDIA DGX Spark и 750 токенов/сек на DGS Station.

DiffusionGemma работает на архитектуре Gemma 4 26B A4B MoE и оптимизирована для низкой задержки при вычислениях. Всего в модели 25,2 млрд параметров, из которых активные — 3,8 млрд, что позволяет поддерживать контекст длиной до 256K токенов.

Как это влияет на российский рынок AI

Для разработчиков в России открывается возможность протестировать и внедрить DiffusionGemma через Hugging Face и другие платформы, что значительно упростит прототипирование и развертывание AI-приложений. С учетом недостатка аналогичных решений в СНГ, поддержка NVIDIA может стать важным фактором для оптимизации затрат на обслуживание.

К примеру, использование новой модели может снизить затраты на генерацию контента на 20-30% по сравнению с традиционными методами, что делает AI более доступным для малых и средних предприятий.

Будущие шаги в развитии AI

Согласно прогнозам, скорость генерации текстов к 2027 году может возрасти до 5000 токенов в секунду, если тенденция оптимизации продолжится. Это откроет новые возможности для использования AI в реальном времени.

Поделиться: Telegram X LinkedIn