NVIDIA представила новые методы оптимизации трансформеров для обучения с использованием низкой точности, позволяя увеличить скорость обучения до 3,48 раза в теории. Ускорение достигается благодаря улучшенной поддержке форматов FP8 и NVFP4 на графических процессорах Hopper и Blackwell, что снижает время на операции GEMM.
Почему это актуально для разработчиков
Трансформеры играют ключевую роль во многих современных моделях AI, и их эффективность напрямую влияет на скорость экспериментов и качество результатов. С ростом размеров моделей, они требуют все больше GPU-часов для обучения, что делает оптимизацию особенно актуальной для команд, работающих с ограниченными ресурсами.
NVIDIA утверждает, что низкочастотные форматы помогают сделать операции матричных произведений быстрее и дешевле. При этом разработчики сталкиваются с задачей: нужно понимать, какие именно реализуются GEMM в их конфигурации трансформера, чтобы правильно выбрать уровень точности, прежде чем переходить к более дорогим тренировкам.
Технические детали оптимизации
NVIDIA предоставляет инструменты, которые позволяют разработчикам создавать оптимизированные версии своих моделей. С помощью библиотеки Transformer Engine можно эффективно обрабатывать квантование и распределение ядер, что открывает доступ к низкоточным форматам. Примечательно, что в ходе экспериментальных тестов на модели CodonFM 5B удалось достичь увеличения скорости до 1,66 раза при использовании NVFP4 по сравнению с MXFP8 в режиме автокастинга.
Однако важно отметить, что большие операции GEMM, такие как MLP Down, показывают наибольшее ускорение, в то время как менее масштабные операции, например, выход внимания, демонстрируют минимальные улучшения использования NVFP4. За счет численных погрешностей и накладных расходов, связанных с квантованием, фактическое ускорение может быть ниже теоретического.
Практическое применение для рынка
Для российских разработчиков это открывает новые горизонты. Использование низкоточных форматов поможет снизить затраты на обучение моделей с огромным количеством параметров, например, для медицинской диагностики или биоинформатики, где ресурсы часто ограничены. Разработчики могут ожидать значительного сокращения времени на обучение, что позволит им быстрее тестировать новые гипотезы и улучшать конечный продукт.
Следующим шагом будут обновления Transformer Engine и дальнейшая оптимизация процессов, что даст возможность достигнуть еще большей скорости обучения, а значит, и увеличения эффективности разработки.