AI И НЕЙРОСЕТИ

NVIDIA оптимизировала трансформеры для обучения с низкой точностью — до 3,48x быстрее

NVIDIA улучшила обработку трансформеров с низкой точностью, достигнув ускорения до 3,48x. Это важно для разработчиков.

✍️ Редакция iTech News | 10.11.2025 | ⏱ 2 мин | Источник: NVIDIA Developer Blog
NVIDIA находит решения для обучения трансформеров с низкой точностью

NVIDIA представила новые методы оптимизации трансформеров для обучения с использованием низкой точности, позволяя увеличить скорость обучения до 3,48 раза в теории. Ускорение достигается благодаря улучшенной поддержке форматов FP8 и NVFP4 на графических процессорах Hopper и Blackwell, что снижает время на операции GEMM.

Почему это актуально для разработчиков

Трансформеры играют ключевую роль во многих современных моделях AI, и их эффективность напрямую влияет на скорость экспериментов и качество результатов. С ростом размеров моделей, они требуют все больше GPU-часов для обучения, что делает оптимизацию особенно актуальной для команд, работающих с ограниченными ресурсами.

NVIDIA утверждает, что низкочастотные форматы помогают сделать операции матричных произведений быстрее и дешевле. При этом разработчики сталкиваются с задачей: нужно понимать, какие именно реализуются GEMM в их конфигурации трансформера, чтобы правильно выбрать уровень точности, прежде чем переходить к более дорогим тренировкам.

Технические детали оптимизации

NVIDIA предоставляет инструменты, которые позволяют разработчикам создавать оптимизированные версии своих моделей. С помощью библиотеки Transformer Engine можно эффективно обрабатывать квантование и распределение ядер, что открывает доступ к низкоточным форматам. Примечательно, что в ходе экспериментальных тестов на модели CodonFM 5B удалось достичь увеличения скорости до 1,66 раза при использовании NVFP4 по сравнению с MXFP8 в режиме автокастинга.

Однако важно отметить, что большие операции GEMM, такие как MLP Down, показывают наибольшее ускорение, в то время как менее масштабные операции, например, выход внимания, демонстрируют минимальные улучшения использования NVFP4. За счет численных погрешностей и накладных расходов, связанных с квантованием, фактическое ускорение может быть ниже теоретического.

Практическое применение для рынка

Для российских разработчиков это открывает новые горизонты. Использование низкоточных форматов поможет снизить затраты на обучение моделей с огромным количеством параметров, например, для медицинской диагностики или биоинформатики, где ресурсы часто ограничены. Разработчики могут ожидать значительного сокращения времени на обучение, что позволит им быстрее тестировать новые гипотезы и улучшать конечный продукт.

Следующим шагом будут обновления Transformer Engine и дальнейшая оптимизация процессов, что даст возможность достигнуть еще большей скорости обучения, а значит, и увеличения эффективности разработки.

Поделиться: Telegram X LinkedIn