NVIDIA представила открытое семейство языковых моделей Nemotron-Labs Diffusion, генерирующих токены на флагманском GPU B200 со скоростью 865 токенов в секунду. Это в 4 раза быстрее традиционного подхода на аналогичном железе, и при этом качество остаётся на высоком уровне.
Что нового в Nemotron-Labs Diffusion
Линейка моделей включает версии с 3, 8 и 14 миллиардами параметров, а также мультимодальную модель на 8 миллиардов с поддержкой изображений. Главным новшеством является метод self-speculation, когда черновик и проверяющий — это одна и та же модель, работающая в разных режимах. Это позволяет сэкономить время, так как за один проход обрабатывается сразу 5-7 токенов, что значительно ускоряет процесс генерации.
Где Nemotron-Labs Diffusion вне конкуренции
Новая модель показывает на 1,2% большую точность, чем Qwen3 8B, и работает в 2,4 раза быстрее на бенчмарке SPEED-Bench. Среднее число принятых токенов за один проход у Nemotron-Labs Diffusion достигает 5,46, по сравнению с 2,75 у лидеров, таких как Eagle3. В задачах программирования, математических вычислениях и многоязычности эта разница становится ещё более заметной: 8,69 против 2,81.
Важность для разработчиков и исследователей
Для разработчиков и исследователей на российском рынке это означает доступ к более быстрым и эффективным инструментам для генерации текстов и обработки данных. Немаловажно и то, что новая модель открыта для использования, что позволяет легче адаптировать её к специфическим задачам без значительных дополнительных затрат.
В ближайшее время ожидается, что NVIDIA продолжит внедрять методы self-speculation в другие языковые модели, что откроет новые возможности для оптимизации работы AI.