GPU xAI к концу года могут приблизиться к отметке 1,44 млн штук: Илон Маск заявил о новой волне подключения ускорителей Nvidia GB300 для суперкомпьютера Colossus. Для русскоязычной IT-аудитории это не просто очередная гонка железа: такие масштабы меняют экономику обучения моделей, рынок инфраструктуры и даже требования к энергетике вокруг дата-центров.
По данным Tom's Hardware, Маск сообщил в X, что еще 220 тыс. Nvidia GB300 должны заработать уже на следующей неделе, еще 220 тыс. — в ноябре, а при удачном сценарии еще 220 тыс. — к концу декабря. Если план сойдется, парк GPU xAI вырастет до уровня, который еще недавно выглядел как презентационный слайд для инвесторов, а не как физически собираемая инфраструктура.
Сейчас конфигурация Colossus выглядит так: первая площадка включает 150 тыс. H100, 50 тыс. H200 и 30 тыс. GB200. Вторая, Colossus 2, уже работает на 110 тыс. GB200 и 440 тыс. GB300. Добавление трех партий по 220 тыс. GB300 доведет число GB300 до 1,1 млн, а общий парк ускорителей — до 1,44 млн GPU. Для компании, которой около трех лет, темп почти вызывающий: Anthropic и OpenAI стартовали заметно раньше, но инфраструктурная гонка теперь измеряется не возрастом бизнеса, а доступом к Nvidia, площадкам, сети и электричеству.
Любопытная деталь: Colossus 1, где смешаны Hopper и Blackwell, оказался не лучшей площадкой для обучения Grok. По версии источника, эту инфраструктуру xAI сдала Anthropic под инференс. Логика понятна: для обучения крупных моделей неоднородность железа быстро превращается в узкое место, а для инференса такую смесь еще можно использовать с пользой. Colossus 2, напротив, построен на Blackwell, что должно снизить риск тормозов внутри кластера. В больших AI-кластерах проблема давно не только в количестве чипов, а в том, насколько предсказуемо они работают как единая машина.
Самая жесткая часть истории — даже не закупка ускорителей. Дефицит Nvidia все еще болезненная тема, но для дата-центров масштаба Colossus главным ограничителем становится энергия. xAI пошла прямолинейным путем: начала подтягивать собственную генерацию. Это уже вызвало конфликт с местными жителями и судебный иск из-за эксплуатации газовых турбин без разрешений. Компания пообещала убрать эти турбины, но не сразу: процесс должен растянуться примерно на год, пока вводится собственная электростанция мощностью 1,2 ГВт.
Для индустрии это важный сигнал. AI-инфраструктура перестает быть только задачей для инженеров по ML и закупщиков серверов. В игру входят энергетики, юристы, муниципальные власти, экологи и соседи по району, которым внезапно достается соседство с промышленным объектом, потребляющим электричество как небольшой город. Когда компания говорит о миллионе GPU на одной площадке, за этой цифрой стоят трансформаторы, газовые турбины, линии электропередачи, вода для охлаждения и разрешительная документация. Романтика нейросетей быстро пахнет подстанцией.
У Маска здесь не эксклюзивная амбиция. Broadcom еще в 2024 году говорила о трех гиперскейлерах, которые хотят выйти на миллион ускорителей к 2027-му, не называя клиентов. Это хорошо описывает рынок: крупнейшие игроки больше не спорят, нужен ли гигантский compute, они спорят, кто быстрее превратит его в работающий продукт и не застрянет на стройке. При этом формулировка online остается скользкой: она может означать установленное оборудование, поданное питание, готовность к нагрузке или реальное участие в обучении и инференсе. Для бизнеса разница огромная, особенно когда речь идет о капитале, который может месяцами стоять без полной загрузки.
Для разработчиков и продуктовых команд масштаб Colossus означает две противоположные вещи. С одной стороны, крупные лаборатории смогут чаще выпускать более тяжелые модели, быстрее проводить эксперименты и агрессивнее снижать задержки в пользовательских сервисах. С другой — порог входа в фундаментальное обучение становится почти недостижимым для независимых игроков. Стартапам придется выбирать: строить поверх чужих моделей, специализироваться на данных и workflow или искать ниши, где компактная модель и хороший продукт бьют грубую вычислительную массу.
Отдельный вопрос — экономика. Миллионные кластеры должны окупаться не красивыми графиками в соцсетях, а нагрузкой: подписками, корпоративными контрактами, агентными сценариями, инфраструктурными сделками. Маск уже говорил о семикратном росте мощностей дата-центров SpaceXAI к 2027 году и о цели в 50 млн H100-эквивалентных GPU к 2030-му. На фоне таких заявлений нынешние 1,44 млн выглядят не финишем, а проверкой: сможет ли рынок AI переварить столько вычислений быстрее, чем энергетика, регуляторы и строительные подрядчики начнут тормозить всю гонку.