Сетевой инженер Google Cloud уронил часть облака, случайно отключив оборудование

Сетевой инженер Google Cloud устроил сбой, случайно отключив от сети оборудование, которое обслуживал. Сервисы компании работали с перебоями несколько часов.

По данным Google, проблемы начались в 07:41 по тихоокеанскому времени. В разгар инцидента объём трафика в пострадавшей области упал на 100%, виртуальные машины были недоступны. Сбой повлиял на работу Compute Engine, Kubernetes Engine, Cloud Run / Google App Engine, AlloyDB для PostgreSQL, Google Cloud Bigtable, BigQuery, Google SecOps SOAR и множества других сервисов. 

Их работу удалось восстановить в 11:52. Как объяснили в компании, причиной стало отключение оптоволоконных кабелей: сетевой инженер последовательно отключил все кабели в течение 13 минут, по всей видимости, невнимательно прочитав инструкцию. 

Как объяснили в Google, при проектировании облачных дата‑центров в компании предусматривают защиту от двойных и даже тройных сбоев, и большинство их них не влияет на трафик клиентов. 

«Чтобы обеспечить такой уровень защиты, оптоволоконные линии физически разделены в каждом ЦОД и имеют разные источники питания», — поясняется в отчёте об инциденте. Однако и такую защиту можно обойти, просто вытащив все кабели.

В компании отмечают, что, обнаружив сбой, трафик перенаправили с отключённых маршрутизаторов на работоспособные мощности в других частях региона. Затем кабели вернули назад, скорость нормализовалась, и трафик был перенаправлен обратно для восстановления работоспособности сети.

Источник: habr.com

0 0 голоса
Рейтинг новости
1
0
Подписаться
Уведомить о
0 комментариев