AI И НЕЙРОСЕТИ

Nvidia оптимизировала работу кластеров GB200 NVL72 с помощью Slurm

Nvidia представила решения для оптимизации кластеров GB200 NVL72 с помощью Slurm, увеличив эффективность распределения задач.

✍️ Редакция iTech News | 20.12.2025 | ⏱ 2 мин | Источник: NVIDIA Developer Blog
Nvidia оптимизировала кластеры GB200 NVL72 с Slurm

Nvidia анонсировала, что её новые кластеры GB200 NVL72 предлагают максимальную производительность с использованием GPU. Эти устройства поддерживают до 72 графических процессоров Blackwell и обеспечивают общую пропускную способность 130 ТБ/с. Это позволяет компаниям значительно улучшить свои вычислительные мощности и эффективно справляться с большими объемами данных.

Что нового в архитектуре GB200 NVL72

Архитектура GB200 NVL72 выделяется тем, что она объединяет память NVLink по всей стойке, что позволяет создать эксаскейл-классы производительности. Каждое GPU обеспечивает 1,8 ТБ/с двусторонней пропускной способности. Важно понимать, что, несмотря на столь высокие показатели, при пересечении доменных границ производительность резко падает. Для решения этой проблемы Nvidia разработала новый блок управления задачами с поддержкой Slurm, использующим правильные стратегии распределения нагрузки.

Как работает новый менеджер задач Slurm

Slurm теперь поддерживает так называемые «блоки топологии», что позволяет администраторам настраивать задачи согласно конкретным требованиям приложения. Это означает, что задачи больше не будут фрагментированы между регионами, что способствует снижению времени ожидания и повышению общей эффективности работы систем. В Slurm внедрены дополнительные возможности, включая поддержку незавершенных блоков и интеграцию с IMEX для управления памятью GPU на драйверском уровне.

Эти нововведения особенно актуальны для больших дата-центров и компаний, работающих с массивами данных. В сценариях с высокой загруженностью данная система управления позволит сохранить производительность на критически важном уровне.

Практическое значение для разработчиков и компаний

Для разработчиков и IT-отделов внедрение решения Nvidia с Slurm — это возможность оптимизировать распределение вычислительных задач и сократить время выполнения рабочих нагрузок. Компании, работающие в сфере ИИ и больших данных, смогут значительно повысить эффективность работы своих систем, что в конечном итоге приведет к сокращению затрат на инфраструктуру.

Следующий шаг — внедрение этой технологии в производственные среды, что ожидается уже в ближайшие месяцы и поможет многим организациям адаптироваться к новым требованиям рынка.

Поделиться: Telegram X LinkedIn