NVIDIA увеличила скорость обучения моделей Mixture of Experts (MoE) на 10,4 раза, достигнув впечатляющих 1,068 TFLOPS на GPU, используя JAX и Transformer Engine. Эта инновация важна, поскольку она позволяет усовершенствовать тренировки крупных AI-моделей и снизить затраты на вычисления.
Контекст и рынок
MoE представляет собой архитектуру, которая стала одной из главных тенденций в обучении крупных AI-решений. Примеры таких моделей, как DeepSeek, показывают эффективность MoE, достигая результатов, сопоставимых с плотными моделями, но при меньших вычислительных затратах. Эта технология увеличивает эффективность обучения через выборочную активацию экспертных сетей, что позволяет существенно сократить нагрузку на систему.
Для понимания масштабов, до внедрения обновлений производительность MoE на NVIDIA GB200 была лишь 103 TFLOPS/GPU, при этом 84% времени уходило на меж-GPU коммуникации. Теперь, после оптимизации с JAX, этот показатель возрос до 1,068 TFLOPS/GPU, что демонстрирует повышение производительности на 10,4 раза.
Технические детали оптимизации
Transformer Engine обеспечивает улучшенную работу с переменным количеством токенов и использует групповое GEMM для обработки без отбраковки и дополнения токенов. Специальные оптимизации, такие как NCCL EP, значительно сокращают сетевой трафик, объединяя этапы распределения и комбинирования токенов. При численности в 1,024 GPU NVIDIA GB300 NVL72, система достигает 97% эффективности масштабирования.
Однако MoE также сталкивается с проблемами из-за динамического распределения токенов между экспертами, что создает «нерегулярные тензоры» и затрудняет оптимизацию операций. Теперь, благодаря специализированным ядрам и оптимизациям, получила развитие технология обработки, позволяющая разгрузить GPU от ожиданий данных.
Практические выводы для разработчиков
Российские команды, работающие в сфере машинного обучения, могут оценить, что внедрение таких технологий, как NVIDIA Transformer Engine, может значительно увеличить скорость любых AI-проектов, работающих с моделями MoE. С учетом того, что затраты на тренировки моделей могут сократиться на 20-30%, это открывает новые горизонты для разработки и внедрения AI-решений на российском рынке.
Следующий шаг для заинтересованных разработчиков — это использование контейнера NVIDIA NGC MaxText с включенным Transformer Engine для воспроизведения оптимизированного маршрута обучения MoE.