Microsoft собирается развернуть AMD Helios Azure в заметных масштабах: речь о стойке с 72 ускорителями Instinct MI455X, 31,1 ТБ памяти HBM4 и производительностью до 1,4 эксафлопс в FP8. Для русскоязычной IT-аудитории это не очередная презентация с красивыми слайдами, а сигнал, что в облачной гонке ИИ у Nvidia становится чуть меньше монополии, а у корпоративных заказчиков и AI-команд может появиться еще один реальный вариант для обучения и инференса крупных моделей.
О партнерстве Microsoft и AMD сообщает Tom's Hardware. По данным издания, Microsoft намерена использовать Helios не только для собственных дата-центров и внутренних AI-задач, но и для клиентов Azure AI Infrastructure. Платформа также должна лечь в основу управляемых вычислений для компаний, которые запускают ИИ-нагрузки через Microsoft Foundry. Иными словами, это не экспериментальная поставка «на пробу», а ставка на то, что спрос на вычисления под модели продолжит расти быстрее, чем рынок успевает строить новые мощности.
С технической стороны Helios выглядит как прямой ответ на rack-scale системы Nvidia. В одну стойку AMD упаковывает 72 GPU Instinct MI455X с суммарными 31,1 ТБ HBM4. Заявленная производительность для AI-нагрузок составляет до 1,4 эксафлопс в FP8 и до 2,9 эксафлопс в FP4. Внутристоечная пропускная способность scale-up заявлена на уровне 260 ТБ/с. Для межстоечного соединения AMD называет 43 ТБ/с через UALink over Ethernet. На бумаге это сопоставимо с системой Nvidia Vera Rubin NVL72 по внутренним связям и выглядит сильнее по scale-out, хотя именно практическая эффективность UALink over Ethernet еще должна пройти проверку реальными кластерами, а не только презентациями.
Это важный момент, потому что рынок ИИ-вычислений уже давно упирается не только в количество GPU. Узкие места теперь живут в межсоединениях, памяти, сетевой обвязке, охлаждении и банально в доступе к электроэнергии. Когда вендоры говорят про эксафлопсы, инженеры дата-центров обычно мысленно переводят это в вопросы попроще: сколько ватт съест стойка, выдержит ли сеть, как быстро данные будут гулять между узлами и не окажется ли половина теоретической мощности съеденной накладными расходами. В этом смысле история с AMD Helios Azure интересна именно тем, что Microsoft готова ставить такую систему в облаке, где маркетинговые цифры быстро встречаются с капризной реальностью продакшена.
Параллельно Microsoft анонсировала новые VM-серии на будущих процессорах AMD Epyc Venice шестого поколения. Серия HDv2 предназначена для «агентного ИИ» и пайплайнов обработки данных, а HXv2 — для задач проектирования полупроводников. Отдельно Microsoft собирается расширять использование AMD Pensando DPU в составе Azure Boost, чтобы ускорять сетевые и storage-операции. Это уже похоже не на разовую закупку видеоускорителей, а на более широкое расширение доли AMD в инфраструктурном стеке Azure: GPU для моделей, CPU для специализированных VM, DPU для разгрузки сети и хранения.
Для AMD это, без преувеличения, один из самых важных фронтов. Компания давно пытается откусить часть дата-центрового GPU-рынка у Nvidia, и за последний год регулярно появлялась в новостях рядом с крупнейшими AI-игроками. В источнике упоминаются крупные партнерства AMD с OpenAI и Meta, а также гигантские масштабы будущих установок, измеряемые уже не серверами, а энергопотреблением целых площадок. Но партнерства сами по себе ничего не гарантируют: чтобы всерьез бодаться с Nvidia, мало выпустить быстрый чип. Нужны зрелый софт, устойчивые библиотеки, понятный путь миграции с CUDA-мира и проверенная экосистема для тех, кто не хочет собирать кластер как конструктор после полуночи.
Именно поэтому интерес Microsoft к Helios важен не только для AMD, но и для рынка облаков. Если гиперскейлер масштаба Azure публично резервирует место под новую платформу, это повышает шансы, что у экосистемы появится достаточный объем пользователей, обратной связи и оптимизаций. Для разработчиков это означает потенциально более широкий выбор вычислительных бэкендов. Для компаний — дополнительный рычаг в переговорах по цене и доступности ресурсов. Для стартапов и AI-лабораторий — шанс не стоять в одной и той же очереди за Nvidia-инстансами вместе со всем миром. Конечно, смена железа не происходит по щелчку: портирование, отладка, профилирование и проверка производительности на реальных моделях останутся обязательными упражнениями. Но сам факт, что альтернативная платформа приходит сразу в Azure, а не в виде редкой экзотики у niche-провайдера, уже меняет расклад.
Есть и менее глянцевая сторона. Microsoft и AMD не раскрыли ни объем развертывания в ваттах, ни стоимость проекта. Это значит, что громкое «at scale» пока стоит воспринимать без фанфар: масштаб есть, но его границы не названы. Кроме того, сама Helios, как пишет источник, выйдет позже в этом году, а значит до массовой проверки остаются вопросы по доступности, стабильности стеков и поведению под смешанными нагрузками. В сегменте ИИ-инфраструктуры слишком многое ломается не в презентации, а на этапе эксплуатации: от дефицита компонентов и сетевых узких мест до задержек в запуске новых дата-центров.
Но даже с этой оговоркой новость выглядит показательно. Рынок ИИ окончательно перешел в фазу, где побеждает не самый громкий анонс, а тот, кто способен поставить много вычислений в облако и удержать их в рабочем состоянии. Если AMD Helios Azure действительно дойдет до больших продакшн-нагрузок, конкуренция в AI-инфраструктуре станет чуть менее декоративной, а вопрос «на чем запускать модель» перестанет иметь один очевидный ответ.