NVIDIA добавила оптимизаторы Muon в Megatron, что повысило эффективность обучения LLM на 2-4% по сравнению с AdamW.