Nvidia представила новый формат NVFP4, который позволяет обучать AI-модели в 1,73 раза быстрее на платформах Blackwell и Rubin. При этом достигается незначительная потеря точности, что критично для эффективного обучения крупных языковых моделей (LLM).
Значение NVFP4 для разработчиков
Скорость обучения становится всё более важным фактором в мире AI, где модели обучаются на триллионах токенов. NVFP4 использует 4-битное смешанное представление, что позволяет существенно сократить время тренировки без жертвы качеством. Испытания на Llama 3 показали значительные приросты производительности на оборудовании Nvidia без изменений в конечной точности моделей.
Для поддержки высокопроизводительного обучения использованы пять ключевых технологий: микроблоки по 16 элементов, selective E4M3 блоки для настройки, случайное преобразование для увеличения устойчивости к выбросам и двуразмерное масштабирование. Эти приемы позволяют сохранить необходимую конвергенцию при уменьшении разрядности.
Что это значит для рынка
Новые технологии от Nvidia предлагают разработчикам улучшенные механики обучения. Ускорение на 1,73 раза может сократить затраты на вычисления и время на проект при большом количестве используемых моделей. Проектам, работающим в сфере AI, нужно задуматься о переходе на платформу Blackwell, чтобы оставаться конкурентоспособными.
Платформы, поддерживающие NVFP4, предоставляют возможность развивать более сложные проекты в рамках прежнего бюджета. Для российских компаний это может стать важным шагом в создании эффективной инфрастуктуры для разработки AI решений.
В следующем месяце ожидается выход полноценной документации по NVFP4, что привлечет внимание к обучению на новых высотах.