Даже управляемая облачная инфраструктура падает от одного неудачного обновления — и Google Cloud это в очередной раз подтвердил. Кривая правка сетевой конфигурации на десять с лишним часов разорвала связность растянутых кластеров (stretched clusters) VMware Engine.
Что произошло
Сбой длился больше десяти часов — с 17:00 UTC 14 июля до 04:46 UTC 15 июля 2026 года. Затронуло три региона:
- Сидней (australia-southeast1)
- Мельбурн (australia-southeast2)
- Франкфурт (europe-west3)
Причиной стало ошибочное обновление сетевой конфигурации, которое нарушило межзонную связность в растянутых кластерах VMware Engine.
Хронология
- 20:24 UTC (14 июля): первое сообщение о проблемах со связностью в растянутых кластерах; вычисления и хранилище при этом работали.
- около 22:24 UTC: расследование выявило сбой межзонного взаимодействия и «флаппинг BGP-сессий между зонами кластера».
- 23:05 UTC: вероятной причиной назвали обновление конфигурации.
- 04:46 UTC (15 июля): инженеры устранили проблему, откатив ошибочную конфигурацию.
Почему это важно
Виртуальные машины продолжали работать, но пользователям стали недоступны. Свидетельский узел (witness appliance) оказался недостижим, из-за чего нарушилась безопасная синхронизация состояния и возник риск потери данных. По сути, растянутые кластеры потеряли главное, ради чего их и строят, — резервирование между несколькими площадками.
Эксперты подчёркивают именно этот урок. Парикх Джайн, глава EIIRTrend, отметил, что инцидент показывает: «даже управляемая облачная инфраструктура может отказать в критически важных общих сетевых компонентах». А вице-президент Counterpoint Research Нил Шах указал, что управляющий слой SDN-оркестрации оказался единой точкой отказа, несмотря на всю физическую избыточность.