NVIDIA проанализировала причины, почему кластеры на базе GPU, таких как H100 и GB200 NVL72, демонстрируют значительные различия в производительности. В ходе исследований выявлено, что потери составляют 8-12% по сравнению с эталонной архитектурой, что критично для пользователей, стремящихся к максимальной эффективности AI-приложений.
Ключевые проблемы производительности
Одна из основных причин снижения производительности связана с неправильной конфигурацией на уровне ядра, гипервизора и библиотек NCCL. Четыре примера реальных условий эксплуатации показывают, что проблемы часто возникают из-за отсутствия необходимых возможностей SMMU и неправильной настройки виртуализации на процессорах NVIDIA Grace, а также неправильной конфигурации управления питанием.
Компании, стремящиеся к максимизации производительности своих кластеров, должны обратить внимание на следующие аспекты: оптимизировать управление питанием CPU, скорректировать конфигурацию NUMA и обеспечить доступность всех топологий и переменных окружения. Без этих настроек кластеры могут не достигнуть 95% порога валидации NVIDIA Exemplar Cloud.
Рекомендации для инженеров
Инженеры, работающие с AI-инфраструктурой, могут применить данные рекомендации для устранения проблем с производительностью. Использование диагностических методов для проверки работы систем, контроля параметров NCCL и выполнения настроек в контейнеризованных वातावरणх позволит минимизировать потери производительности.
Чтобы воспроизвести результаты, необходимо наличие кластеров на базе NVIDIA HGX и стабильный рабочий процесс с использованием NVIDIA NeMo и других моделей. Это позволит сбалансировать производительность и достичь необходимых результатов при проведении обучающих задач.
Как это влияет на разработчиков
Для разработчиков AI это означает, что значительные настройки инфраструктуры и тщательная проверка конфигураций становятся критически важными для достижения максимальной производительности. Если ваша команда нацелена на создание эффективной AI-системы, необходимо учитывать потенциальные потери из-за конфигурационных ошибок и быть готовыми к их устранению.
Следующий шаг для NVIDIA — продолжение работы по улучшению инструментов для мониторинга и настройки AI-инфраструктуры, чтобы снизить вероятность неэффективности в работе кластеров.