У NASA снова узкое место не в ракете и не в капсуле, а в канале связи. Во время пилотируемой Artemis II агентство повторно нагрузило Deep Space Network так, что вопрос пропускной способности глобальной сети антенн из инженерной детали превратился в управленческую проблему. Для IT-аудитории история предсказуемо знакомая: легаси-инфраструктура, растущий поток данных, старые клиенты, которые потребляют больше заявленного, и новый критичный сервис, которому нельзя отказать.
На этот раз, как пишет Ars Technica, сеть выдержала лучше, чем во время Artemis I в конце 2022 года. Тогда коммуникационная инфраструктура NASA не успевала одновременно обслуживать около 40 роботизированных научных миссий и прожорливую по телеметрии капсулу Orion, летевшую вокруг Луны. Из-за приоритета Artemis I агентству пришлось урезать или откладывать передачу данных с нескольких заметных научных программ, включая телескоп James Webb и марсоходы. И это была еще беспилотная миссия. У Artemis II планка выше по определению: на борту четыре астронавта, а значит, требования к связи, телеметрии и обмену данными строже.
Формально NASA помогла более короткая длительность миссии. Artemis II провела в космосе чуть больше девяти дней, тогда как Artemis I шла 25 дней. Кроме того, в первый полет Orion ушли 10 малых спутников CubeSat, которым тоже понадобились трекинг и связь через ту же самую сеть. У Artemis II таких попутных аппаратов было меньше, поэтому давление на Deep Space Network оказалось не таким хаотичным. Но главный вывод NASA не в том, что повезло с профилем миссии, а в том, что после провала 2022 года пришлось менять процессы: координацию между миссиями, правила планирования и порядок подтверждения доступной емкости сети.
Об этом прямо сказал Грег Хеклер, заместитель руководителя по развитию возможностей в программе Space Communications and Navigation. По его словам, после Artemis I NASA пересобрала процессы вокруг расписания и согласования ресурсов не только для Orion, но и для всех миссий, сидящих на DSN. Судя по обратной связи от научного подразделения агентства, результат оказался лучше ожидаемого. В переводе с бюрократического на инженерный это означает простую вещь: без жесткого оркестратора и внятного capacity planning даже огромная космическая сеть превращается в общий ресурс, за который все борются в ручном режиме.
Проблема, впрочем, никуда не делась. Спрос на DSN только растет. Сейчас сеть с антеннами в Калифорнии, Испании и Австралии поддерживает около 40 работающих миссий. В ближайшие 10 лет к ним добавится еще примерно 40. При этом многие старые аппараты живут заметно дольше расчетного срока, а значит, не освобождают ресурс тогда, когда это было заложено на бумаге. Хеклер отдельно отметил неприятную, но очень земную деталь: некоторые миссии используют больше емкости сети, чем указано в их документации. Для любой IT-команды это звучит как знакомый сюжет про сервис, который давно вышел за пределы изначальных SLA, но продолжает спокойно жить в проде, потому что «ну он же пока работает».
NASA теперь требует обязательное исследование осуществимости перед подключением новых миссий к DSN, чтобы понять, хватит ли мощности под очередное обязательство. На практике это попытка заменить исторически накопившийся оптимизм данными и анализом. Повод более чем конкретный: уже в августе должен стартовать космический телескоп Nancy Grace Roman, и NASA ожидает, что он вернет через DSN больше данных, чем все предыдущие астрофизические миссии агентства вместе взятые. Если раньше Deep Space Network можно было считать дорогой, но все же универсальной магистралью, то теперь это ресурс, для которого приходится строить внутренний admission control.
Есть и более неприятный слой проблемы: сама инфраструктура сети не выглядит образцом отказоустойчивости. Во время Artemis I у NASA вышла из строя подсистема Private Cloud Appliance, после чего агентству пришлось получать дополнительные ресурсы от программы Moon to Mars и ставить новый модуль до Artemis II. А в прошлом году сеть потеряла еще и одну из трех 70-метровых антенн в комплексе Goldstone возле Барстоу в Калифорнии. Это как раз тот класс оборудования, который нужен для связи с самыми удаленными миссиями. Антенна отслеживала аппарат Juno у Юпитера, когда из-за переразворота были повреждены кабели и водяные линии системы пожаротушения. На основание установки вылилось около 200 тысяч галлонов воды с гликолем, из-за чего инцидент получил еще и экологическое измерение.
Разбор причин получился болезненно знакомым любому, кто хотя бы раз разгребал последствия аварии на старой критичной системе. Следователи указали не только на технические сбои, но и на процессные: недостаточное обучение, слабые письменные инструкции, зависимость от недокументированных практик и «неявного знания», а также проблемы в логике управления антенной. Финальный предохранитель от переразворота, гидравлическая лимитная система, оказался серьезно поврежден еще в каком-то прошлом, толком не задокументированном инциденте. По журналам работ ее последний раз тестировали в 2004 году. Если убрать космический антураж, это чистый кейс про цену технического долга, накопленного в инфраструктуре, которую считают слишком важной, чтобы останавливать, и слишком старой, чтобы быстро модернизировать.
Ремонт антенны NASA оценивает в сумму от 4,1 до 4,6 млн долларов, но в строй ее собираются возвращать не сразу: восстановление объединят с уже запланированным циклом модернизации, и система останется недоступной до 2028 года. Параллельно агентство пытается разгрузить Deep Space Network за счет отдельной лунной инфраструктуры Lunar Exploration Ground Sites, а коммерческие компании строят спутники-ретрансляторы для орбиты Луны. NASA также успешно испытала на Artemis II лазерную связь на Orion, и это выглядит не как красивая демонстрация, а как попытка заранее найти дополнительный канал для будущего трафика. Вопрос теперь не в том, справится ли DSN с одной следующей миссией, а в том, успеет ли NASA перестроить архитектуру связи раньше, чем лунная программа и научные аппараты окончательно превратят сеть в космический аналог перегруженного дата-центра.