Темата за големите инциденти в съвременните ЦОД предизвиква въпроси, на които в първата статия нямаше отговори — решихме да я развием.

Ако вярваме на статистиката на Uptime Institute, голяма част от инцидентите в дата-центровете е свързана с откази в електрическите системи — те съставляват 39 % от инцидентите. Следва човешкият фактор — това са още 24 % от инцидентите. Третата по важност причина (15 %) са откази в системите за охлаждане, а на четвърто място (12 %) са природните бедствия. Общата част на останалите неприятности е едва 10 %. Без да поставяме под съмнение данните на уважаваната организация, ще откроим нещо общо в различните инциденти и ще се опитаме да разберем, дали е можело да бъдат избегнати. Спойлер: в повечето случаи е можело.
Науката за контактите
Определяйки просто, с електрическото захранване има само две проблеми: или контактът липсва там, където трябва да има, или той е там, където не трябва да бъде. Можем да спорим дълго за надеждността на съвременните системи за непрекъсваемо захранване, но те не винаги помагат. Вземете например нашумелия случай с центъра за данни на British Airways, собственост на материнската компания International Airlines Group. Неподалеку от летище Хитроу се намират два подобни обекта — Boadicea House и Comet House. В първия от тях на 27 май 2017 г. стана случайно прекъсване на електрическото захранване, което доведе до претоварване и отказ на системата за непрекъсваемо захранване. В резултат част от ИТ оборудването беше физически повредено, а за отстраняването на последния инцидент бяха необходими три дни.
Авиокомпанията трябваше да отмени или отложи над хиляда полета, около 75 хиляди пътници не успяха да излетят навреме — за изплащането на компенсации бяха похарчени 128 млн. долара, без да се включват разходите за възстановяване работоспособността на дата-центровете. Историята с причините за блэкаута е неясна. Ако вярваме на резултатите от вътрешното разследване, озвучени от генералния директор на International Airlines Group Уили Уолш, причината е грешка на инженерите. Въпреки това, системата за непрекъсваемо захранване е трябвало да понесе такова прекъсване — затова е инсталирана. ЦОД се управляваха от специалисти на аутсорсинг компанията CBRE Managed Services, поради което British Airways се опита да възстанови сумата на щетите чрез лондонския съд.

Излизанията с електрическо захранване се случват по подобни сценарии: първо има изключване по вина на доставчика на електрическа енергия, понякога заради лошо време или вътрешни проблеми (включително грешки на персонала), а след това системата за непрекъсваемо електрозахранване не издържа на натоварването или краткотрайно прекъсване на синусоидата причини откази на много услуги, за възстановяване на работоспособността на които отнема много време и средства. Може ли да се избегнат подобни аварии? Безусловно. Ако системата е проектирана правилно, обаче от грешки не са застраховани дори създателите на големи ЦОД.
Човешкият фактор
Когато непосредствената причина за инцидента са неправилните действия на персонала на дата центъра, проблемите най-често (но не винаги) засягат програмната част на ИТ инфраструктурата. Такива аварии се случват дори в големи корпорации. През февруари 2017 година заради неправилно набран текст от член на екипа за техническа експлоатация на един от ЦОД-ите, част от сървърите на Amazon Web Services бяха изключени. Грешката се случи по време на отстраняване на проблеми с процеса на фактуриране на клиентите на облачното хранилище Amazon Simple Storage Service (S3). Служителят се опитваше да изтрие определен брой виртуални сървъри, използвани от фактуриращата система, но случайно повреди по-голям клъстер.

В резултат на грешката на инженера бяха изтрити сървъри, на които бяха активни важни програмни модули на облачното хранилище на Amazon. На първо място пострада подсистемата за индексиране, съдържаща информация за метаданни и местоположението на всички обекти S3 в американския регион US-EAST-1. Инцидентът засегна също подсистемата, използвана за съхранение на данни и управление на наличното за съхранение пространство. След изтриването на виртуалните машини тези две подсистеми изискваха пълен рестарт, а после инженерите на Amazon се сблъскаха с изненада — в продължение на продължителен период от време публичното облачно хранилище не успя да обслужва клиентски заявки.
Ефектът се оказа мащабен, тъй като много големи ресурси използват Amazon S3. Проблемите в работата засегнаха Trello, Coursera, IFTTT и, което е най-неприятно, услугите на големи партньори на Amazon от списъка S&P 500. В такива случаи е трудно да се оцени щетата, но тя възлиза на стотици милиони долара. Както виждате, за да се провали услугата на най-голямата облачна платформа, е достатъчна една неверна команда. Това не е единичен случай, на 16 май 2019 г. по време на профилактични работи услугата Яндекс.Облако виртуални машини на потребители в зона ru-central1-c, които поне веднъж са били в статус SUSPENDED. Тук вече пострадаха клиентски данни, част от които бяха безвъзвратно загубени. Разбира се, хората не са съвършени, но съвременните системи за информационна сигурност отдавна умеят да контролират действията на привилегированите потребители преди изпълнението на техните команди. Ако в Яндекс или Amazon се внедрят подобни решения, подобни инциденти могат да бъдат избегнати.

Замразяване на охлаждането
През януари 2017 г. стана голям инцидент в дмитровския ЦОД на компания „Мегафон“. Тогава температурата в московския регион падна до −35 °C, което доведе до неработоспособност на системата за охлаждане на обекта. Прес-службата на оператора не разкри много информация относно причините за инцидента — руските компании много неохотно говорят за аварии на собствените си обекти, в публичен аспект изоставаме значително от Запада. В социалните мрежи циркулираше версия за замразяване на хладоносителя в тръбите, прокарани по улицата, и изтичане на етиленгликол. Ако трябва да вярваме на тази версия, експлоатационната служба не успя поради дългите празници своевременно да получи 30 тона хладоносител и се справяше с използването на подръчни средства, организирайки импровизирано фрикулинг с нарушение на правилата за експлоатация на системата. Силните студове задълбочиха проблема — през януари в Русия изненадващо настъпи зима, въпреки че никой не я очакваше. В крайна сметка персоналът беше принуден да откачи част от сървърните стелажи, поради което някои услуги на оператора не бяха достъпни в продължение на два дни.

Вероятно, тук става дума и за климатична аномалия, но такива студове не са нещо необичайно за столичния регион. Температурата през зимата в Подмосковието може да падне и под по-ниски стойности, затова дата центровете се строят с разчет за надеждна работа при −42°С. Най-често системите за охлаждане отказват при студ заради недостатъчно висока концентрация на гликоли и излишък на вода в разтвора на топлоносителя. Срещат се проблеми и с монтажа на тръби или с проектирането и тестването на системата, свързани главно с желанието за икономия. В резултат на това на необичайно място настъпва сериозна авария, която всъщност можеше да бъде предотвратена.
Природни бедствия
Най-често гръмотевици и/или урагани нарушават работата на инженерната инфраструктура на дата центъра, което води до спиране на услугите и/или физическо увреждане на оборудването. Инциденти, предизвикани от лошото време, се случват доста често. През 2012 г. по западното крайбрежие на САЩ премина ураганът Санди с силен дъжд. Разположеният в небостъргач на долния Манхатън дата център Peer 1 , след като солената морска вода наводни мазетата. Аварийните генератори на обекта бяха разположени на 18-ия етаж и запасът от гориво за тях беше ограничен — въведените в Ню Йорк след атентатите от 11 септември правила забраняват съхранението на голямо количество гориво на горните етажи.
Горивният помпа също се повреди, затова персоналът ръчно носеше дизел за генераторите дни наред. Геройството на екипа спаси дата центъра от сериозна авария, но наистина ли беше необходимо? Живеем на планета с азотнокислородна атмосфера и много вода. Гръмотевици и урагани тук са обичайно явление (особено в крайбрежните райони). Проектантите вероятно трябваше да вземат предвид рисковете, свързани с тях, и да изградят подходяща система за непрекъснато електрозахранване. Или поне да изберат по-подходящо място за дата центъра, отколкото небостъргач на острова.
Всичко останало
В тази категория Uptime Institute откроява разнообразни инциденти, от които трудно може да се избере типичен. Кражби на медни кабели, нараняващи ЦОД, опори за високо напрежение и трансформаторни станции, автомобили, пожари, повреждащи оптиката, екскаватори, гризачи (плъхове, зайци и дори вомбати, които всъщност принадлежат към сумчатите), както и любители на стрелба по жици — менюто е обширно. Неуспехи в електрическото захранване могат да бъдат причинени дори електрическа енергия незаконна плантация на марихуана. В повечето случаи виновниците за инцидента са конкретни личности, т.е. отново имаме работа с човешкия фактор, когато проблемът носи име и фамилия. Дори ако на пръв поглед инцидентът е свързан с техническа неизправност или природни бедствия, той може да бъде избегнат при условие на правилно проектиране на обекта и адекватна експлоатация. Изключения съставят единствено случаи на критично повреждане на инфраструктурата на ЦОД или разрушаване на сгради и съоръжения заради природна катастрофа. Това наистина са форсмажорни обстоятелства, а всички останали проблеми са причинени от прокладката между компютъра и стола — вероятно това е най-ненадеждната част от всяка сложна система.
Източник: habr.com
