AI И НЕЙРОСЕТИ

NVIDIA улучшила обучение LLM на 57% благодаря вынесению памяти на хост

NVIDIA внедрила метод вынесения активов на хост в JAX, что увеличило производительность обучения LLM до 57%.

✍️ Редакция iTech News | 17.10.2025 | ⏱ 2 мин | Источник: NVIDIA Developer Blog
NVIDIA улучшила обучение LLM на 57% благодаря вынесению памяти на хост

NVIDIA внедрила метод вынесения активов на хост при обучении больших языковых моделей (LLM) с использованием библиотеки JAX, что позволяет увеличить производительность на 57%. Этот подход важен для разработчиков, учитывая постоянно растущие требования к вычислительным ресурсам и памяти моделей.

Контекст развития метода

Современные большие языковые модели сталкиваются с серьезными ограничениями по объемам оперативной памяти на графических процессорах (GPU). С увеличением размеров моделей и объемов обучающих выборок, конкуренция за ресурсы высокоскоростной памяти (HBM) становится критической. Вынесение активов на хост предлагает альтернативный подход, позволяя работать с большими объемами данных без необходимости перерасчета значений активов на каждом этапе.

Практическое применение метода

Системы NVIDIA Grace Blackwell продемонстрировали, что выполнимая оптимизация процесса обучения LLM достигается путем перемещения активов в закрепленную хост-память во время прямого прохода и их возвращения назад при обратном проходе. В эксперименте с использованием комбинации Latency Hiding Scheduler и попеременных передач, производительность достигла 57% по сравнению с традиционным методом перерасчета активов.

Согласно данным, проведенные тесты на платформе NVIDIA GB200 NVL72 с моделями DeepSeek-V3 и Llama 3.1 подтвердили, что оптимизация работы с памятью открывает потенциальные возможности для применения больших разреженных моделей. Активные переработки данных становятся особенно выгодны при обработке больших объемов, что подчеркивает важность производительности и эффективного использования ресурсов.

Польза для разработчиков

Для команд, работающих с AI на русском рынке, переход на новые методы оптимизации является критическим шагом. Разработчики смогут использовать ресурсы более эффективно, значительно ускоряя процесс обучения модели и уменьшив время отклика. Внедрение подобного подхода также позволит избежать покупок дополнительных GPU, сэкономив закладываемый бюджет на инфраструктуру.

Следующий этап — внедрение данного метода в более широкие масштабы с целью тестирования его эффективности на других моделях и платформах. Эксперименты планируют провести на различных конфигурациях для дальнейшего повышения производительности.

Поделиться: Telegram X LinkedIn