Атака на дата-центр Яндекса в Сасове Рязанской области привела к крупному пожару и отключению площадки, на которой размещались десятки тысяч серверов. Сбой затронул клиентов Yandex Cloud и показал неприятную для российского IT-рынка вещь: потеря одного узла может быстро превратиться из локального инцидента в проблему для облака, ритейла, банковских систем и обучения ИИ-моделей.
По данным Tom's Hardware, после удара украинских беспилотников «Яндекс» рекомендовал клиентам переводить нагрузку в альтернативные зоны доступности. Компания заявляла о сохранении работы ключевых потребительских сервисов, однако пользователи сообщали о неполадках в Почте, Диске, Документах, Pay и Маркете. О сбоях также сообщали сервисы ЦИАН, «Литмаркет», РЖД, футбольный клуб «Спартак», криптобиржа Rapira, «Астрал» и решения на платформе 1С.
Огонь в Сасове и зависимость от одной площадки
Региональные власти подтвердили пожар на промышленном объекте после атаки, но публично не уточнили, какая именно инфраструктура стала целью. Дата-центр «Яндекса» расположен на территории бывшего станкостроительного завода «Саста», где компания работает с 2014 года. Сам завод выпускает промышленное оборудование, в том числе для предприятий, связанных с оборонным сектором. Поэтому пока нельзя уверенно сказать, был ли целью именно облачный объект или промышленная площадка рядом с ним.
Для пользователей причина пожара не меняет практической картины: отказала инфраструктура, от которой зависят внешние и внутренние цифровые продукты. По информации Detector404, за сутки было зафиксировано 58 268 жалоб. Проблемы, по сообщениям СМИ, затронули и корпоративные системы Т-Банка, Ozon и Wildberries. Один из подмосковных автобусных перевозчиков приостанавливал онлайн-продажу билетов. Недоступными оказывались сайты ряда российских медиа, включая РИА Новости, «Вести» и «Интерфакс», использовавших пострадавшего инфраструктурного партнёра.
Для облачных клиентов это не просто очередной эпизод с недоступностью веб-интерфейса. При серьёзной аварии проверяется вся архитектура отказоустойчивости: распределены ли базы данных между зонами, можно ли переключить очереди и объектное хранилище, где лежат резервные копии, насколько автоматизировано восстановление. Формально наличие второй зоны ещё не гарантирует выживаемость сервиса: если приложение завязано на один кластер, общий балансировщик, единый секрет-менеджер или ручные процедуры, резервная площадка остаётся скорее красивым слайдом в презентации.
Под вопросом — вычислительные мощности для ИИ
Особый риск связан с суперкомпьютерами, которые, как сообщалось, находились в Сасове. Речь идёт о системах «Червоненкис» и «Ляпунов» на ускорителях Nvidia A100; обе использовались для обучения моделей искусственного интеллекта, включая YandexGPT. Третий суперкомпьютер «Галушкин» расположен во Владимире. «Яндекс» не сообщал, пострадали ли конкретно эти машины, поэтому утверждать об их уничтожении преждевременно. Но масштаб пожара делает этот вопрос далеко не академическим.
«Червоненкис» в 2021 году занимал 19-е место в рейтинге Top500 с производительностью 21,53 PFLOPS в тесте FP64. Позднее система опустилась примерно к 101-й позиции: индустрия суперкомпьютеров за несколько лет ушла далеко вперёд. Однако для владельца это не превращает кластер в металлолом. Такие мощности включают не только GPU, но и сетевую фабрику, системы хранения, питание, охлаждение, настроенную программную среду и накопленные процессы эксплуатации. Восстановить подобный комплекс после физического повреждения сложно даже при свободном рынке оборудования.
Российским компаниям доступ к современным ИИ-ускорителям и серверным платформам ограничен санкциями. Поэтому возможная утрата Nvidia-инфраструктуры в Сасове была бы болезненна не из-за позиции в рейтинге, а из-за дефицита замен. Обучение крупных моделей можно переносить на другие доступные кластеры или внешние мощности, в том числе китайские, но это меняет экономику, сроки и требования к данным. Для разработчиков это означает более прагматичный тренд: разделять обучение и инференс, избегать привязки к одному поставщику и заранее проектировать переносимость пайплайнов между площадками.
Инцидент развивается на фоне ударов по украинской цифровой инфраструктуре: с 23 сентября, по данным источника, атаки повредили или уничтожили дата-центры как минимум восьми украинских компаний, включая Virtual Systems, MiroHost, CosmoNova, DataGroup и CityHost. Часть украинской инфраструктуры переносят в защищённые или подземные площадки. Российский бизнес, в свою очередь, обсуждает размещение систем в странах, которые сохраняют рабочие технологические связи с Москвой. Но географический перенос не заменяет инженерную дисциплину: резервирование должно быть проверено реальным переключением, а не только прописано в SLA.
Главный открытый вопрос — состояние «Червоненкиса» и «Ляпунова», а также сроки полного восстановления площадки и клиентских сервисов. Атака на дата-центр Яндекса уже стала тестом не только для облачной платформы, но и для рынка, который привык считать дата-центр невидимой базовой коммунальной услугой. В нынешних условиях физическая устойчивость инфраструктуры становится такой же частью продукта, как API, мониторинг и цена виртуальной машины.