Centrele de date moderne sunt fiabile, totuși orice echipament se defectează din când în când. Într-o notă concisă, am adunat cele mai semnificative incidente din 2018.

Influența tehnologiilor digitale asupra economiei crește, volumele de informații procesate se măresc, se construiesc noi obiective, și acesta este un lucru bun, atât timp cât totul funcționează. Din păcate, influența întreruperilor din centrele de date asupra economiei crește de asemenea, de când oamenii au început să își plaseze infrastructura IT critică pentru afaceri în acestea – o consecință inevitabilă a digitalizării. Publicăm o mică selecție a celor mai notabile accidente care au avut loc în diferite țări anul trecut.
SUA
Această țară este recunoscută ca lider în construcția de centre de date. În SUA există cele mai multe centre comerciale și corporative mari centrelor de date, care servesc servicii globale, așa că consecințele incidentelor din acestea sunt cele mai semnificative. La începutul lunii martie, din cauza unui ciclon puternic, patru obiective ale operatorului Equinix au avut probleme cu alimentarea cu energie. Spațiile au fost utilizate pentru echipamentele Amazon Web Services (AWS), iar accidentul a dus la inaccesibilitatea multor servicii populare: au fost afectate GitHub, MongoDB, NewVoiceMedia, Slack, Zillow, Atlassian, Twilio și Capital One, precum și asistentul virtual Amazon Alexa.
În septembrie, anomaliile climatice au lovit centrele de date Microsoft situate în statul Texas, atunci când, din cauza furtunilor, alimentarea cu energie electrică a întregii regiuni a fost întreruptă, iar într-un centru de date care a trecut la alimentarea de la generatoare diesel, sistemul de racire s-a oprit inexplicabil. Remedierea efectelor accidentului a durat câteva zile și, deși datorită echilibrării încărcăturii acest defect nu a devenit critic, utilizatorii din întreaga lume au observat o oarecare încetinire a serviciilor cloud Microsoft.
Rusia
Cel mai grav accident a avut loc pe 20 august într-unul dintre centrele de date ale Rostelecom. Din cauza acestuia, serverele Registrului Național Unic al Proprietății Imobiliare s-au oprit timp de 66 de ore, ceea ce a dus la necesitatea transferării acestora pe un site de rezervă. Procesarea solicitărilor venite din toate canalele a reînceput abia pe 3 septembrie – organizația de stat încearcă să recupereze o sumă mare de bani de la Rostelecom pentru încălcarea acordului de nivel de serviciu.
Pe 16 februarie, din cauza problemelor în rețelele Lenenergo, a fost activată sistemul de alimentare electrică de rezervă în centrul de date al companiei Xelnet (Sankt Petersburg). O întrerupere temporară a sinusoidei a cauzat perturbări în funcționarea multor servicii: printre acestea a fost afectat, în special, un mare furnizor de cloud, 1cloud, dar cea mai vizibilă problemă pentru publicul rus de pe internet a fost imposibilitatea de a accesa site-ul rețelei sociale „VKontakte”. Ceea ce este cel mai interesant este că eliminarea completă a consecințelor întreruperii temporare a alimentării electrice a durat aproximativ 12 ore.
Uniunea Europeană
În UE, în 2018, au fost înregistrate câteva incidente grave. În martie, a avut loc o defecțiune în centrul de date al companiei aeriene KLM: alimentarea cu energie electrică a fost oprită timp de 10 minute, iar puterea instalațiilor cu generatoare diesel s-a dovedit insuficientă pentru funcționarea echipamentului. O parte servere s-au deconectat, iar companiile aeriene au fost nevoite să anuleze sau să reprogramaze mai multe zboruri.
Acesta nu este singurul incident legat de transporturile aeriene; deja în aprilie, o defecțiune a avut loc în sistemul de alimentare electrică al centrului de date Eurocontrol. Organizația gestionează traficul aerian în Uniunea Europeană, iar în timp ce specialiștii au lucrat 5 ore pentru a remedia consecințele accidentului, pasagerii au fost nevoiți din nou să suporte întârzieri și reprogramări ale zborurilor.
Problemele extrem de grave apar din cauza accidentelor în centrele de date care servesc sectorul financiar. Costul întreruperilor în efectuarea tranzacțiilor aici este de obicei foarte mare, iar nivelul de fiabilitate al obiectivelor este corespunzător, dar incidentele nu pot fi evitate. Pe 18 aprilie, bursa Nordic NASDAQ (Helsinki, Finlanda) nu a putut desfășura tranzacții în întreaga Nordul Europei timp de o zi din cauza activării neautorizate a sistemului de stins incendii cu gaze într-un centru de date comercial DigiPlex, care a fost deconectat de urgență.
Pe 7 iunie, problemele din centrul de date au forțat bursa de valori din Londra (London Stock Exchange, LSE) să amâne începutul tranzacțiilor cu o oră. În plus, în iunie, pe teritoriul Europei, din cauza unei defecțiuni în centrul de date, serviciile sistemului internațional de plăți VISA au fost deconectate timp de o zi, detaliile incidentului nefiind făcute publice.
Japonia
În vara anului 2018, la nivelurile subterane ale centrului de date Amazon aflat în construcție în suburbia Tokyo a avut loc un incendiu în urma căruia au murit 5 muncitori și au fost răniți cel puțin 50. Focul a deteriorat aproximativ 5000 m2 de spații ale obiectivului. Investigația a arătat că incendiul a fost cauzat de factorul uman: izolația s-a aprins din cauza manipulării necorespunzătoare a aragazurilor cu acetilenă.
Cauzele defecțiunilor
Lista incidentelor prezentată nu este completă, din cauza avariilor din centrele de date, clienții băncilor și telecomunicațiilor suferă, servicii ale furnizorilor de cloud ies offline și chiar activitatea serviciilor de urgență este afectată. O mică întrerupere a serviciului poate duce la pierderi semnificative; conform datelor de la Uptime Institute, majoritatea defecțiunilor (39 %) sunt legate de sistemul de alimentare cu energie. Pe locul doi (24 %) este factorul uman, iar pe locul trei (15 %) se află sistemul de climatizare. Fenomenele naturale reprezintă doar 12 % din accidentele din centrele de date, iar doar 10 % dintre acestea au cauze diferite de cele enumerate.
În ciuda standardelor stricte de fiabilitate și siguranță, niciun obiectiv nu este complet ferit de incidente. Cele mai multe dintre acestea se întâmplă din cauza defecțiunilor de alimentare cu electricitate sau a greșelilor personalului. Aceste două aspecte ar trebui să primească o atenție deosebită din partea proprietarilor de centre de date și camere server, iar clienții ar trebui să înțeleagă: chiar și liderii de piață nu pot garanta o fiabilitate absolută. Dacă echipamentele sau serviciul de cloud susțin procese critice pentru afacere, ar trebui să se ia în considerare o locație de rezervă.
Sursa foto: telecombloger.ro
Sursa: habr.com
