AWS заявила, что ее новая сеть дата-центров AWS на базе архитектуры Resilient Network Graphs дает до 33% больше пропускной способности, требует на 69% меньше сетевых устройств и снижает энергопотребление сети на 40%. Для клиентов облака это не академическое упражнение про теорию графов, а сигнал куда приземленнее: базовая инфраструктура крупнейшего облачного провайдера уже меняется под рост AI-нагрузок, стоимости энергии и постоянную гонку за эффективностью.
Речь идет о новой сетевой архитектуре дата-центров, о которой, как пишет Tom's Hardware, AWS рассказала публично только сейчас, хотя внедрять ее начала еще в 2024 году. По словам компании, RNG уже стала архитектурой по умолчанию для большинства рабочих нагрузок AWS. Первый запуск состоялся в дата-центре в Дублине, затем схему расширили на площадки в Германии и Испании, а теперь ее разворачивают в большинстве новых дата-центров.
Смысл изменения в том, что AWS уходит от привычной иерархии, на которой десятилетиями держались крупные облака. Классическая топология fat-tree устроена как дерево из уровней коммутаторов и маршрутизаторов: трафик поднимается вверх, потом спускается вниз. Конструкция надежная и давно обкатанная, но у нее есть известная болезнь гипермасштаба: трафик любит собираться в узких местах, даже если в других участках сети пропускная способность простаивает. Чем больше кластер, тем дороже обходятся эти «пробки» и тем больше железа нужно, чтобы держать запас по росту.
Вместо этого AWS продвигает более плоскую квазислучайную схему, основанную на random graph theory. В такой сети устройства соединяются не по строгой иерархии, а более распределенно, так что между узлами появляется много возможных маршрутов. На бумаге это давно выглядело красиво: выше устойчивость, лучше загрузка каналов, меньше вероятность локальной перегрузки. На практике у идеи был серьезный минус: построить и эксплуатировать такую сеть на масштабе облака крайне сложно. Нужно не только эффективно маршрутизировать трафик в менее предсказуемой среде, но и физически развернуть огромное количество оптических соединений так, чтобы эксплуатация не превратилась в бесконечный кошмар для инженеров.
AWS утверждает, что закрыла обе проблемы. За программную часть отвечает собственный протокол маршрутизации Spraypoint. Вместо того чтобы по максимуму гнать трафик по кратчайшему пути, он распределяет потоки по большому числу доступных маршрутов. Это важный сдвиг: в сетях такого масштаба «самый короткий путь» не всегда самый полезный, если он уже забит. Вторая часть решения — пассивное оптическое устройство ShuffleBox, которое должно упростить и стандартизировать кабельную обвязку. Иначе говоря, AWS придумала не только красивую математику, но и способ не утонуть в миллионах оптоволоконных линий.
Цифры, которые приводит компания, выглядят достаточно агрессивно даже по меркам гиперскейлеров. До 33% прироста пропускной способности — это уже не косметика. Сокращение числа сетевых устройств на 69% — еще более важный показатель, потому что он бьет сразу по нескольким статьям расходов: капитальным затратам, стойкам, питанию, охлаждению и обслуживанию. Отдельно AWS говорит о снижении инфраструктурных затрат до 45% и намекает на экономию в миллиарды долларов в масштабе своей глобальной облачной сети. Здесь стоит быть аккуратными: это оценка самой AWS, а не независимый аудит. Но даже если реальная выгода окажется скромнее, направление понятно — сеть внутри дата-центра стала таким же полем оптимизации, как процессоры, хранилища и системы охлаждения.
Контекст у этой истории тоже вполне прозрачный. В разговорах про AI-инфраструктуру обычно на первых ролях GPU, память HBM, дефицит электроэнергии и новые системы охлаждения. Но у больших кластеров есть менее публичная проблема: данные нужно быстро и стабильно гонять между тысячами и сотнями тысяч серверов. Без этого мощные ускорители начинают банально ждать сеть. Для облачных платформ это особенно чувствительно: сеть должна одновременно обслуживать AI-нагрузки, базы данных, приложения, объектные хранилища и все остальное, что клиенты запускают в AWS. Если базовая сеть дата-центров AWS становится быстрее и дешевле, это влияет не на один продукт, а на экономику всего облака.
Для разработчиков и архитекторов здесь важен не только сам анонс, но и то, что он говорит о будущем облачной инфраструктуры. Во-первых, крупные провайдеры все активнее уходят в глубоко кастомные решения, где выигрывает не один удачный чип, а вся связка из протоколов, оптики, топологии и софта управления. Во-вторых, сеть перестает быть «прозрачным слоем», который просто обязан работать. Она становится источником конкурентного преимущества. Если провайдер реально может переваривать больше трафика на меньшем количестве устройств и с меньшим энергопотреблением, это рано или поздно отражается либо в марже, либо в цене сервисов, либо в скорости запуска новых мощностей. Для IT-директоров и фаундеров вывод простой: облако все сильнее продает не виртуалки как таковые, а инженерную глубину под капотом, которую снаружи почти не видно.
Есть и более широкий отраслевой эффект. AWS фактически заявляет, что одна из старых академических идей наконец доросла до реального гипермасштаба. Если RNG действительно станет стандартом для большинства новых площадок компании, конкуренты вряд ли проигнорируют такой сигнал. Следующий интересный вопрос не в том, может ли случайный граф работать в дата-центре, а в том, насколько быстро подобные схемы начнут проникать в инфраструктурный мейнстрим и как сильно они перекроят экономику строительства облаков в эпоху AI.