ПРОДУКТЫ И ГАДЖЕТЫ

Omni-Path вернулся: Минэнерго США дало шанс альтернативе InfiniBand

Кластер Lynx в LLNL запустили на сети Omni-Path 400 Гбит/с: технология Cornelis Networks вернулась в HPC как альтернатива InfiniBand.

✍️ Редакция iTech News | 17.06.2026 | ⏱ 5 мин | Источник: The Register
📷

В лаборатории Lawrence Livermore National Laboratory запустили кластер Lynx на 952 узла, и его собрали не на привычном InfiniBand, а на сети Omni-Path с пропускной способностью 400 Гбит/с. Для рынка HPC это не просто очередной апгрейд стойки: у американских госзаказчиков снова появилась живая альтернатива доминирующей сетевой фабрике Nvidia, а для инженеров и закупщиков это сигнал, что монополия в суперкомпьютерных интерконнектах не выглядит вечной.

О запуске системы сетью Omni-Path сообщает The Register. Речь идет о кластере Lynx, который ввели в строй по заказу National Nuclear Security Administration для задач моделирования, симуляции и анализа в контуре одной из самых закрытых частей американской вычислительной инфраструктуры. С вычислительной точки зрения машина не пытается изображать новый рекорд Top500: в ней 952 сервера Dell Technologies PowerEdge на процессорах Intel Xeon Scalable 4-го поколения, известных под кодовым именем Sapphire Rapids. Но интерес здесь не в CPU и не в бренде шасси, а в том, чем именно связаны все эти узлы между собой.

На этом месте обычно стоят либо проприетарный HPE Cray Slingshot 11, либо InfiniBand от Nvidia. Lynx пошел по третьему пути: Cornelis Networks поставила для него коммутаторы и сетевые адаптеры семейства CN5000. Для отрасли это заметный эпизод сразу по двум причинам. Во-первых, у заказчиков уровня Минэнерго США появился еще один вариант для non-Cray систем. Во-вторых, этот вариант уже работает на скорости 400 Гбит/с, тогда как значительная часть развернутых в лабораториях DoE Cray-систем до сих пор эксплуатируется на 200 Гбит/с.

История тут с привкусом хорошего корпоративного дежавю. Omni-Path родился внутри Intel еще в 2015 году как без потерь работающий интерконнект для высокопроизводительных вычислений. По архитектурной логике это родственник InfiniBand: низкие задержки, предсказуемое поведение и ставка на масштабирование без того, чтобы сеть становилась главной проблемой кластера. Ранними пользователями были, в частности, Trinity в Los Alamos и Cori. Затем Intel в 2019 году фактически свернула направление, а в 2020-м активы выделили в отдельную компанию. Для многих на этом история Omni-Path и закончилась. Но в 2025 году Cornelis вернулась с линейкой CN5000 и обещанием 400-гигабитной связности с почти линейным ростом производительности при увеличении масштаба.

Почему это важно не только для американских лабораторий

Главный тезис Cornelis звучит довольно приземленно и потому убедительно: если кластер растет, именно сеть очень быстро начинает красть производительность, за которую уже заплачено в процессорах, памяти и электропитании. Гендиректор Cornelis Networks Лиза Спелман заявила, что на Lynx компания показала 91% эффективности масштабирования сети для кластера такого размера. Это как раз тот показатель, который не выглядит яркой маркетинговой наклейкой для баннера, но хорошо читается людьми, которые строят и эксплуатируют HPC-инфраструктуру. Если сеть не рассыпается под ростом числа узлов, заказчик получает больше полезной отдачи без постоянной борьбы с узкими местами в fabric.

Спелман идет еще дальше и утверждает, что Lynx может обгонять сопоставимые по размеру кластеры даже с более новыми процессорами именно за счет более эффективного интерконнекта. Звучит дерзко, но в логике HPC это не ересь. На реальных нагрузках сетевой стек и топология могут съесть преимущество от более свежего CPU куда быстрее, чем любят признавать в презентациях поставщики железа. Для разработчиков параллельных приложений и команд, которые занимаются MPI-стеком, это старая новость: если обмен данными устроен плохо, лишние гигагерцы не спасают.

Есть и более широкий рыночный контекст. InfiniBand в последние годы оказался в зоне повышенного спроса из-за AI-кластеров, где гигантские бюджеты и спешка с вводом мощностей в эксплуатацию поднимают ставки во всей цепочке поставок. На этом фоне появление альтернативы важно не только технически, но и коммерчески. Когда у крупного заказчика есть работающий третий вариант, кроме Slingshot и InfiniBand, это меняет переговорную позицию, сроки поставки и сам подход к архитектуре будущих систем. Особенно в тех сегментах, где не нужен тот же набор компромиссов, что в инфраструктуре под обучение больших моделей.

Для российской IT-аудитории эта история интересна сразу на нескольких уровнях. Инфраструктурным командам она напоминает, что в HPC и AI-кластерах вопрос уже давно не сводится к выбору CPU или ускорителя: интерконнект снова становится отдельной стратегической осью. Продактам и основателям компаний, работающих вокруг железа, платформ или системного ПО, кейс Lynx показывает, что нишевая технология может вернуться на рынок, если у нее есть внятный proof point у требовательного заказчика. А для тех, кто отвечает за закупки и архитектуру, это еще один аргумент против ленивой мысли, что «все равно все закончится InfiniBand».

Что дальше

Cornelis уже говорит, что Lynx не останется единичной витриной. Компания работает над новыми системами, включая конфигурации с «нетрадиционными» ускорителями, хотя без конкретики по вендорам и архитектурам. Параллельно она готовит семейство CN6000 с оборудованием на 800 Гбит/с, выход которого ожидается во второй половине 2026 года. Здесь расчет завязан на появление CPU с поддержкой PCIe Gen 6.0 от Intel, AMD и других поставщиков: при PCIe 5.0 обычные NIC, по сути, упираются в потолок около 400 Гбит/с. Некоторые игроки обходят это встроенными крупными PCIe-коммутаторами в сетевых картах, но это добавляет цене и конструкции лишнюю головную боль. Если Cornelis действительно выкатит 800 Гбит/с без такого усложнения и заодно добавит поддержку Ethernet, рынок HPC получит не просто редкую альтернативу, а потенциально более гибкий сетевой стек. Проверить исходные детали и цитаты можно в публикации The Register.

Поделиться: Telegram X LinkedIn