Nvidia установила рекорд в 1,648 TFLOPs на графическом процессоре при предварительном обучении своей модели DeepSeek-V3 с 671 миллиардами параметров. Эта инновация подчеркивает эффективность новых архитектур MoE, которые значительно увеличивают вычислительные мощности, позволяя исследователям быстрее обучать более крупные модели.
Прогресс в архитектуре MoE
Согласно данным Nvidia, благодаря новой инфраструктуре, разработанной на базе GB300 NVL72, вычисления на токен упали, что позволяет более эффективно использовать ресурсы GPU. MoE архитектуры активируют лишь подмножество параметров для каждого токена, что позволяет модели действовать на уровне мощности большой модели при низких затратах.
В частности, DeepSeek-V3 активирует лишь примерно 37 миллиардов параметров на токен, что позволяет достичь frontier-уровня с затратами, сопоставимыми с небольшими моделями. Это кардинально меняет подходы к обучению и масштабированию крупных языковых моделей.
Как это повлияет на AI-разработчиков
Рекорд Nvidia важен для разработчиков в России и СНГ, так как он указывает на необходимость учитывать масштабы вычислительной инфраструктуры при планировании AI-проектов. С увеличением мощности GPUs и улучшением их эффективности, компании смогут экспериментировать с более амбициозными проектами, что в свою очередь приведет к быстрому развитию технологий.
Обсуждая возможности, стоит отметить, что только за последние несколько лет эффективность MoE архитектур привела к революционным изменениям в области AI. Разработчики, работающие на платформе Nvidia, получают все преимущества от этого прогресса через более высокую производительность без необходимости в значительных дополнительных вложениях в оборудование.
Следующий шаг для Nvidia — это интеграция результатов последних разработок в коммерческие продукты и полный вывод их на рынок в ближайшие кварталы.