
Сетевой инженер Google Cloud устроил сбой, случайно отключив от сети оборудование, которое обслуживал. Сервисы компании работали с перебоями несколько часов.
По данным Google, проблемы начались в 07:41 по тихоокеанскому времени. В разгар инцидента объём трафика в пострадавшей области упал на 100%, виртуальные машины были недоступны. Сбой повлиял на работу Compute Engine, Kubernetes Engine, Cloud Run / Google App Engine, AlloyDB для PostgreSQL, Google Cloud Bigtable, BigQuery, Google SecOps SOAR и множества других сервисов.
Их работу удалось восстановить в 11:52. Как объяснили в компании, причиной стало отключение оптоволоконных кабелей: сетевой инженер последовательно отключил все кабели в течение 13 минут, по всей видимости, невнимательно прочитав инструкцию.
Как объяснили в Google, при проектировании облачных дата‑центров в компании предусматривают защиту от двойных и даже тройных сбоев, и большинство их них не влияет на трафик клиентов.
«Чтобы обеспечить такой уровень защиты, оптоволоконные линии физически разделены в каждом ЦОД и имеют разные источники питания», — поясняется в отчёте об инциденте. Однако и такую защиту можно обойти, просто вытащив все кабели.
В компании отмечают, что, обнаружив сбой, трафик перенаправили с отключённых маршрутизаторов на работоспособные мощности в других частях региона. Затем кабели вернули назад, скорость нормализовалась, и трафик был перенаправлен обратно для восстановления работоспособности сети.
Источник: habr.com