Одно обновление конфигурации на 10 часов уронило VMware Engine в облаке Google

Даже управляемая облачная инфраструктура падает от одного неудачного обновления — и Google Cloud это в очередной раз подтвердил. Кривая правка сетевой конфигурации на десять с лишним часов разорвала связность растянутых кластеров (stretched clusters) VMware Engine.

Что произошло

Сбой длился больше десяти часов — с 17:00 UTC 14 июля до 04:46 UTC 15 июля 2026 года. Затронуло три региона:

  • Сидней (australia-southeast1)
  • Мельбурн (australia-southeast2)
  • Франкфурт (europe-west3)

Причиной стало ошибочное обновление сетевой конфигурации, которое нарушило межзонную связность в растянутых кластерах VMware Engine.

Хронология

  • 20:24 UTC (14 июля): первое сообщение о проблемах со связностью в растянутых кластерах; вычисления и хранилище при этом работали.
  • около 22:24 UTC: расследование выявило сбой межзонного взаимодействия и «флаппинг BGP-сессий между зонами кластера».
  • 23:05 UTC: вероятной причиной назвали обновление конфигурации.
  • 04:46 UTC (15 июля): инженеры устранили проблему, откатив ошибочную конфигурацию.

Почему это важно

Виртуальные машины продолжали работать, но пользователям стали недоступны. Свидетельский узел (witness appliance) оказался недостижим, из-за чего нарушилась безопасная синхронизация состояния и возник риск потери данных. По сути, растянутые кластеры потеряли главное, ради чего их и строят, — резервирование между несколькими площадками.

Эксперты подчёркивают именно этот урок. Парикх Джайн, глава EIIRTrend, отметил, что инцидент показывает: «даже управляемая облачная инфраструктура может отказать в критически важных общих сетевых компонентах». А вице-президент Counterpoint Research Нил Шах указал, что управляющий слой SDN-оркестрации оказался единой точкой отказа, несмотря на всю физическую избыточность.