Nvidia анонсировала новые ядра MLP, которые позволяют увеличить производительность моделей с механизмом смешанных экспертов (MoE) до 93%. Это решение поможет разработчикам сократить время обучения AI-моделей, что критично в условиях растущего спроса на эффективные вычисления.
Фон нововведения
Сегодня MoE-модели становятся основой больших AI-систем, так как они предлагают возможность масштабировать модели, используя лишь часть параметров для обработки каждого токена. Это особенно актуально, когда речь идет о моделях, которые растут в размерах, что требует оптимизации для обеспечения максимальной пропускной способности тренировки.
Nvidia разработала специальные MLP-ядра, применяя CuTe DSL, чтобы справиться с памятью и синхронизацией. Это позволяет избежать больших накладных расходов, достигая 1,3-2 раз меньшего времени обработки по сравнению с незасоединёнными путями. Подобные улучшения имеют решающее значение для повышения общей производительности систем.
Специфика новинок
Новые ядра поддерживают продвинутые функции активации, такие как SwiGLU и GeGLU, что делает возможным более эффективное использование памяти. Они также способны обрабатывать различные форматы, включая MXFP8 и NVFP4, что приводит к значительным улучшениям в вычислительной производительности. В тестах на установках DeepSeek-V3 и GPT-OSS было зафиксировано увеличение производительности на 8% и 93% соответственно.
CEO Nvidia Дженсен Хуанг отметил: «Эти новые достижения в оптимизации MoE помогут разработчикам увеличить производительность и снизить затраты на обучение». Важно, что ядра доступны сейчас в NVIDIA cuDNN Frontend и через NVIDIA Transformer Engine, что обеспечивает бесшовную интеграцию в рабочие процессы.
Что это значит для разработчиков
Для российской IT-аудитории это означает, что разработчики могут значительно снизить затраты на обучение своих моделей и оптимизировать использование ресурсов. Команды, работающие с AI, должны обратить внимание на эти новые возможности, так как внедрение таких технологий может привести к росту производительности в 1,5-2 раза за счет более эффективного использования доступных вычислительных ресурсов.
Следующий шаг для Nvidia — продолжить развитие и оптимизацию своих технологий, чтобы оставаться в авангарде AI-инноваций.