AI И НЕЙРОСЕТИ

NVIDIA увеличила производительность вывода до 15 раз с DFlash на Blackwell

NVIDIA внедрила DFlash, увеличившую производительность вывода на Blackwell до 15 раз. Подробности о разработке и ее значении.

✍️ Редакция iTech News | 03.11.2025 | ⏱ 2 мин | Источник: NVIDIA Developer Blog
NVIDIA увеличила производительность вывода до 15 раз с DFlash

NVIDIA представила DFlash, открытый блоковий 모델 для спекулятивного декодирования, который значительно увеличивает производительность вывода на GPU Blackwell. Согласно тестам, этот инструмент позволяет упростить обработку запросов, увеличивая производительность до 15 раз для модели gpt-oss-120b.

Что такое DFlash и как он работает

DFlash использует подход, при котором токены обрабатываются блоками, а не по одному, смог создавать более оптимизированные потоки данных. Это приводит к увеличению загрузки GPU и более высокому значению пропускной способности. Например, DFlash увеличивает интерактивность использования модели Llama 3.1 8B почти в два раза по сравнению с EAGLE-3 при одинаковой конкуренции.

Подключение к основным фреймворкам и совместимость

Интеграция DFlash в такие популярные фреймворки, как SGLang и TensorRT-LLM, позволяет разработчикам внедрять его без изменения кода. Это сделает технологии NVIDIA более доступными для широкого спектра пользователей, включая разработчиков в СНГ. Публикация двадцати контрольных точек DFlash на Hugging Face уже открыла двери для NVIDIA Blackwell и Hopper GPU.

Значение для рынка разработчиков и тяготение к многопользовательским рабочим процессам

С переходом к согласованным многоагентным рабочим процессам критически важна низкая задержка в выводе. Для команд, занимающихся разработкой и внедрением AI-систем в России, использование DFlash может стать весомым аргументом для повышения эффективности и производительности их приложений. Ожидается, что интеграция нового инструмента изменит рынок AI, обеспечив значительные преимущества.

Следующий шаг — поддержка и расширение применения DFlash в других фреймворках, что будет означать еще больший рост производительности для разработчиков, работающих с моделями AI.

Поделиться: Telegram X LinkedIn