Сбои в дата-центрах случаются реже, но бьют сильнее: половина операторов, опрошенных Uptime Institute, за последние три года пережила заметный или серьезный инцидент, и это минимальный уровень с 2020 года. Проблема в другом: аварии длятся дольше, а каждый пятый случай теперь обходится дороже $1 млн. Для команд, которые отвечают за архитектуру, SLA и бюджеты на инфраструктуру, это плохая новость: выигрыш в надежности все чаще съедает сложность самой платформы.
Об этом сообщает The Register со ссылкой на свежий отчет Uptime Institute. Аналитики фиксируют парадоксальную картину: в среднем отрасль стала устойчивее, но последние «девятки» доступности даются все тяжелее. Частота отказов снижается уже не так быстро, как раньше, а значит, классические меры повышения отказоустойчивости начинают давать все меньше эффекта. Это не история про расслабившихся операторов. Скорее наоборот: дата-центры упираются в физические и инженерные ограничения, которые пять лет назад не выглядели столь болезненными.
Главный ускоритель этой проблемы — инфраструктура под ИИ. Речь не только о тренинге, но и об inference-нагрузках, которые массово ставят в те же контуры эксплуатации. Более плотные стойки, скачущая нагрузка и работа ближе к пределам доступной мощности повышают риск каскадных отказов. Когда запас по электричеству и охлаждению сокращается, любая локальная проблема перестает быть локальной. Отказ одного элемента уже не обязательно заканчивается заменой модуля и выездом дежурной смены: он может потянуть за собой соседние системы, а потом и сервисный простой. Для бизнеса это означает неприятную вещь: инвестиции в ускорители, плотную упаковку железа и быстрый ввод мощностей автоматически повышают цену ошибки.
Вторая линия риска — банальная нехватка критически важного оборудования. Генераторы, switchgear, трансформаторы, силовые и охлаждающие системы по-прежнему сложно и долго закупать, поэтому часть операторов идет на компромисс: берет бывшее в употреблении или недостаточно проверенное оборудование. Uptime прямо пишет, что это, вероятно, уже внесло вклад в ряд аварий и инцидентов. На бумаге такая экономия выглядит как способ не срывать сроки запуска площадки. На практике она превращается в скрытый долг, который всплывает в самый дорогой момент — когда нагрузка уже посажена, SLA подписаны, а окно на ошибку измеряется минутами.
Электропитание остается главным источником крупных аварий, хотя и здесь есть улучшение. В 2025 году проблемы с питанием стали причиной 45 процентов самых чувствительных отказов, тогда как в 2024-м показатель составлял 54 процента. То есть отрасль явно научилась лучше работать с традиционными рисками. Но расслабляться рано: Uptime предупреждает, что картина может снова ухудшиться на фоне перегруженных локальных энергосетей. Даже если сбой внешней сети не станет основной причиной простоя, он легко бьет по цепочке переключения на резервное питание. У дата-центра есть ограниченное окно, чтобы перейти на onsite-генераторы, а те, как показывает практика, тоже умеют подводить. И чем агрессивнее рынок наращивает мощности, тем больше давление не на серверы, а на всю электромеханику вокруг них.
Есть и третий фронт — сеть. По данным отчета, именно сетевые проблемы чаще всего становятся причиной IT-сбоев. Дата-центр может формально оставаться живым, но неудачная конфигурация сети все равно превращает это в полноценный outage для клиента. Хорошая новость в том, что массовое внедрение software-defined networking и автоматического перераспределения трафика немного выправило ситуацию. Доля респондентов, которые за последние три года не столкнулись ни с одним сбоем IT-сервисов, выросла до 20 процентов — это на девять пунктов больше, чем годом ранее. Плохая новость в том, что цифровая инфраструктура становится все более распределенной, а значит, источник проблемы все чаще находится за пределами самого здания: поврежденная оптика, сбой связности, зависимость от внешнего облачного сервиса или отказ на соседней площадке.
Именно здесь начинается самая неприятная часть для архитекторов и SRE-команд. Софтверная отказоустойчивость действительно помогает переживать локальные инциденты вроде пореза магистрали: рабочая нагрузка уезжает на другие площадки, клиент ничего не замечает, отчетность выглядит красиво. Но у такой схемы есть цена — сложность. Чем больше availability zones, каналов, политик маршрутизации и перекрестных зависимостей, тем труднее гарантировать, что отказ останется в пределах одной зоны. Uptime напоминает: распределение нагрузки по нескольким площадкам не спасает, если сам сценарий деградации захватывает сразу несколько сайтов. Для бизнеса это уже не инженерная тонкость, а вопрос проектной дисциплины. Мультисайт без жесткой проверки отказовых сценариев легко превращается в дорогую имитацию надежности.
По длительности инцидентов тренд тоже неприятный. Большинство публично известных аварий по-прежнему укладывается в 12 часов — таких 55 процентов. Но доля сбоев, которые продолжаются больше 48 часов, растет второй год подряд. Во многом это связано как раз с внешними факторами, включая повреждения волоконно-оптических линий: такие случаи, по оценке Uptime, происходили более чем вдвое чаще обычного. Отсюда и деньги. Чем дольше простой, тем выше косвенные потери, а на инфраструктуре, плотно загруженной ИИ-задачами, стоимость часа простоя особенно неприятна. Неудивительно, что каждый пятый инцидент уже превышает планку в $1 млн, и аналитики ожидают дальнейший рост. Для операторов, облаков и крупных enterprise-заказчиков это означает простую вещь: в следующие годы обсуждать придется не только надежность как процент в презентации, но и экономику отказа в условиях перегруженной, распределенной и энергоемкой инфраструктуры.
Сбои в дата-центрах, похоже, входят в новую фазу: меньше рутины, больше редких, длинных и дорогих аварий. Если этот тренд закрепится, выигрывать будут не те, кто быстрее поставил еще один кластер под ИИ, а те, кто умеет считать пределы по питанию, тестировать деградацию между площадками и не подменять реальную устойчивость красивой схемой резервирования.