Два изолированных дата-центра AWS в Объединенных Арабских Эмиратах отключены, что привело к сбоям в работе системы хранения S3. Этот инцидент возник из-за воздействия дронов на здания, и большинство команд с планами по аварийному восстановлению (DR) столкнулись с трудностью реализации в условиях внезапного отключения.
Несмотря на наличие продуманных стратегий управления рисками, многие компании не тестировали сценарий одновременной потери двух AZ с отсутствием возможности восстановления. Как показывает практика, довольно сложно «наживу» выполнить поставленные задачи с устаревшими картами зависимостей и под давлением времени. В результате многие команды лишь задокументировали планы в Confluence, но не проверили их работоспособность в экстренной ситуации.
Один из пользователей Reddit, который делится своими впечатлениями, отметил, что планы по восстановлению данных «в существовавшем виде не сработали». Обновления проверки состояния для Route 53, автоматические сценарии восстановления и другие инструменты не сработали, когда это было необходимо. Задачи, которые казались очевидными, оказались непредсказуемыми, а карта зависимостей — устаревшей на шесть месяцев.
Для IT-менеджеров этот инцидент служит напоминанием о важности тщательного тестирования резервных копий и DR-планов. Чем более актуальной будет информация о зависимостях, тем легче будет управлять процессами в условиях кризиса.
Что касается ближайших шагов, аналитики рекомендуют пересмотреть и обновить стратегии DR, чтобы избежать повторения подобных инцидентов в будущем.