Сбой Microsoft 365 23 июля быстро вышел за рамки обычной «просадки в облаке»: в 11:11 по времени восточного побережья США Downdetector насчитал 2403 жалобы при обычном фоне в 29. Для русскоязычных IT-команд это не чужая история про Северную Америку, а наглядное напоминание, что корпоративная инфраструктура на одном вендоре может одновременно потерять чат, файлы, автоматизацию и админку.
По данным BleepingComputer, инцидент стартовал в 10:44 AM ET 23 июля и в первую очередь затронул пользователей, которые заходили в Microsoft 365 по определённым сетевым маршрутам в Северной Америке. Больше всего жалоб пришлось на SharePoint — 78%, затем на Excel — 11%, ещё 6% затронули Microsoft 365 Admin Center. Microsoft вынесла инцидент в административный центр под номером MO1437424 и признала деградацию сразу нескольких сервисов, а не локальную проблему в одном продукте.
Набор симптомов получился неприятно показательный. В OneDrive доступ стал прерывистым. В SharePoint Online пользователи видели ошибку «Something went wrong». В Microsoft Teams деградировал чат, в том числе перестали нормально загружаться изображения. Microsoft 365 Admin Center у части клиентов открывался медленно или не открывался вообще. Power Automate не загружал потоки, Copilot Chat отвечал с задержками или сбоил на запросах и действиях, а Microsoft Loop не открывал страницы. Если перевести это с языка статус-панели на язык операционки бизнеса, то речь про одновременный удар по совместной работе, документообороту, внутренним ботам и части автоматизации.
Особенно показательно, что пострадал не только пользовательский слой, но и инструменты администрирования. Когда у вас падает Teams, это неприятно. Когда вместе с ним тормозит Admin Center, а Power Automate перестаёт поднимать потоки, инцидент становится заметно дороже: служба поддержки дольше диагностирует причину, команды переключаются на ручные обходные сценарии, а руководители получают классический набор из трёх вопросов без быстрого ответа — что именно сломалось, кого затронуло и когда восстановится. Для компаний, где Microsoft 365 давно стал не «почтой и офисом», а куском производственного контура, это уже не бытовая авария, а сбой в ежедневных процессах.
Сначала Microsoft попыталась смягчить проблему через перераспределение трафика на части затронутой инфраструктуры. По телеметрии это дало частичное восстановление для некоторых пользователей, но общую картину не выправило. Более того, ранние попытки вернуть сервисы в норму, по словам компании, успеха не принесли, а точного срока восстановления на тот момент не было. Это редкий случай, когда вендор прямо посоветовал клиентам проверить свои планы непрерывности бизнеса и аварийного восстановления. Для корпоративного рынка формулировка жёсткая, но честная: если облачный стек у вас один, то и точка отказа, как выясняется, тоже одна.
Дальше коммуникация пошла по привычному для крупных SaaS-инцидентов сценарию, но с важной деталью. В 1:55 PM ET Microsoft сообщила, что, вероятно, нашла причину проблемы и разворачивает меры по устранению, пообещав в течение примерно 30 минут дать новую оценку их эффективности. Уже к вечеру ситуация начала выправляться, а в 9:55 PM ET издание обновило материал: Microsoft откатила сетевое обновление и заявила, что проблема устранена. Компания отдельно написала в X, что завершила rollback сетевого апдейта и подтвердила восстановление по телеметрии сервиса и отзывам клиентов. Иначе говоря, источником инцидента оказался не внешний фактор и не массовая атака, а собственное изменение в сетевом слое, которое пришлось срочно отыгрывать назад.
На фоне последних месяцев это выглядит не как исключение, а как часть более широкого тренда: даже зрелые облачные платформы всё чаще ломаются не от экзотики, а от сложности самой среды. Чем плотнее связаны файлы, коммуникации, автоматизация, AI-функции и административный контур, тем выше шанс, что ошибка в одном инфраструктурном изменении заденет сразу полдюжины продуктов. В этой истории рядом оказались SharePoint, OneDrive, Teams, Power Automate, Loop и Copilot Chat — набор, который ещё пару лет назад воспринимался как разные коробки, а теперь фактически живёт в одном сервисном организме.
Для разработчиков и IT-руководителей здесь есть несколько приземлённых выводов без лишней драмы. Первый: проверять нужно не только резервное копирование данных, но и обходные рабочие сценарии для людей — чем команда общается, где лежат критичные документы, как вручную запускаются процессы, если автоматизация встала. Второй: статус-страницы вендора полезны, но их мало, если зависимость от одной экосистемы тотальная. Третий: AI-функции вроде Copilot Chat уже нельзя считать «надстройкой для удобства» — они встроены в рабочие процессы достаточно глубоко, чтобы их деградация попадала в общую стоимость инцидента наравне с файлами и чатом.
Сбой Microsoft 365 в этот раз формально был региональным и длился меньше суток, но урок у него глобальный. Чем активнее корпорации собирают совместную работу, автоматизацию и AI-инструменты в одном облаке, тем важнее становится не обещание высокой доступности, а способность пережить день, когда даже у Microsoft приходится откатывать сетевое обновление и заново вспоминать, где у компании лежит план Б.