Google совместно с NVIDIA выпустила модель DiffusionGemma, которая генерирует до 1000 токенов в секунду на платформе NVIDIA H100. Это новшество позволит значительно ускорить разработку AI-приложений, таких как чат-ассистенты и копилоты, благодаря параллельной генерации текстов.
Преимущества DiffusionGemma
С помощью DiffusionGemma разработчики смогут генерировать tekstовые токены более эффективно. Модель использует диффузионное подавление шума, чтобы одновременно создавать 256 токенов за шаг. Это позволяет достичь скорости генерации на уровне 150 токенов/сек на NVIDIA DGX Spark и 750 токенов/сек на DGS Station.
DiffusionGemma работает на архитектуре Gemma 4 26B A4B MoE и оптимизирована для низкой задержки при вычислениях. Всего в модели 25,2 млрд параметров, из которых активные — 3,8 млрд, что позволяет поддерживать контекст длиной до 256K токенов.
Как это влияет на российский рынок AI
Для разработчиков в России открывается возможность протестировать и внедрить DiffusionGemma через Hugging Face и другие платформы, что значительно упростит прототипирование и развертывание AI-приложений. С учетом недостатка аналогичных решений в СНГ, поддержка NVIDIA может стать важным фактором для оптимизации затрат на обслуживание.
К примеру, использование новой модели может снизить затраты на генерацию контента на 20-30% по сравнению с традиционными методами, что делает AI более доступным для малых и средних предприятий.
Будущие шаги в развитии AI
Согласно прогнозам, скорость генерации текстов к 2027 году может возрасти до 5000 токенов в секунду, если тенденция оптимизации продолжится. Это откроет новые возможности для использования AI в реальном времени.