Grandi incidenti nei data center: cause e conseguenze

I moderni data center sono affidabili, ma qualsiasi attrezzatura, di tanto in tanto, si guasta. In una breve nota abbiamo raccolto i principali incidenti del 2018.

Grandi incidenti nei data center: cause e conseguenze

L'impatto delle tecnologie digitali sull'economia è in crescita, aumenta il volume delle informazioni elaborate, vengono costruiti nuovi impianti, e va tutto bene finché tutto funziona. Sfortunatamente, l'impatto delle interruzioni nei data center sull'economia cresce anche esso da quando le persone hanno iniziato a posizionare le loro infrastrutture IT critiche per il business al loro interno: è una conseguenza inevitabile della digitalizzazione. Pubblicheremo una breve raccolta dei più significativi incidenti avvenuti in vari paesi nell'anno passato.

USA

Questo paese è riconosciuto come leader nella costruzione di data center. Negli Stati Uniti si trovano il maggior numero di grandi commerciali e aziendali centri di elaborazione dati, che servono i servizi globali, quindi le conseguenze degli incidenti in essi sono le più significative. All'inizio di marzo, a causa di un potente ciclone, quattro impianti dell'operatore Equinix hanno subito malfunzionamenti nel sistema di alimentazione. Gli spazi erano utilizzati per le attrezzature di Amazon Web Services (AWS), l'incidente ha portato all'inaccessibilità di molti servizi popolari: sono stati colpiti GitHub, MongoDB, NewVoiceMedia, Slack, Zillow, Atlassian, Twilio e Capital One, oltre al assistente virtuale Amazon Alexa.

A settembre, anomalie meteorologiche hanno colpito i data center Microsoft situati nello stato del Texas, allora a causa di un temporale si è interrotta l'alimentazione di un'intera regione, e in un data center passato a alimentazione in standby, il sistema di raffreddamento si è spento per motivi sconosciuti. Ci sono voluti diversi giorni per riparare i danni dell'incidente, e sebbene grazie al bilanciamento del carico questo guasto non sia diventato critico, alcuni utenti in tutto il mondo hanno notato un certo rallentamento nei servizi cloud di Microsoft.

Russia

Il più grave incidente si è verificato il 20 agosto in uno dei data center di Rostelecom. A causa di esso, i server del Registro Unico Statale degli Immobili si sono fermati per 66 ore, rendendo necessario il loro spostamento su un sito di riserva. La registrazione delle richieste ricevute su tutti i canali è stata ripristinata solo il 3 settembre: l'organizzazione statale sta cercando di recuperare da Rostelecom una somma considerevole per la violazione dell'accordo sul livello di servizio.

Il 16 febbraio, a causa di problemi nelle reti di Lenenergo, è stato attivato il sistema di alimentazione elettrica di emergenza nel centro dati dell'azienda Xelnet (San Pietroburgo). L'interruzione temporanea della sinusoide ha causato malfunzionamenti in molti servizi: in particolare, un grande provider di cloud 1cloud ha subito danni, ma il problema più evidente per il pubblico internet russo è stato l'impossibilità di accedere al sito della rete sociale «VKontakte». La cosa più interessante è che la completa eliminazione delle conseguenze dell'interruzione di corrente temporanea ha richiesto circa 12 ore.

Unione Europea

Nell'UE sono stati registrati diversi gravi incidenti nel 2018. A marzo, c'è stata un'interruzione nel data center della compagnia aerea KLM: l'alimentazione elettrica è stata interrotta per 10 minuti e la potenza degli impianti diesel generatori si è rivelata insufficiente per far funzionare le attrezzature. Parte server si sono spenti e le compagnie aeree hanno dovuto cancellare o riprogrammare dozzine di voli.

Questo non è l'unico incidente legato ai voli aerei: già ad aprile si è verificata un'interruzione nel sistema di alimentazione del data center di Eurocontrol. L'organizzazione gestisce il traffico aereo nell'Unione Europea e, mentre gli specialisti hanno impiegato 5 ore per riparare i danni, i passeggeri hanno dovuto nuovamente subire ritardi e riprogrammazioni dei voli.

Problemi molto seri sorgono a causa di incidenti nei data center che servono il settore finanziario. Il costo delle interruzioni nelle transazioni in questo caso è generalmente elevato, e il livello di affidabilità degli oggetti è corrispondente, ma non riesce a prevenire gli incidenti. Il 18 aprile, la borsa valori Nordic NASDAQ (Helsinki, Finlandia) non ha potuto effettuare scambi in tutta la Scandinavia per un'intera giornata a causa dell'attivazione non autorizzata del sistema antincendio a gas in un data center commerciale di DigiPlex, che è stato disalimentato.

Il 7 giugno, i problemi operativi del data center hanno costretto la borsa valori di Londra (London Stock Exchange, LSE) a posticipare l'inizio degli scambi di un'ora. Inoltre, a giugno, in Europa, a causa di un guasto nel data center, i servizi del sistema di pagamento internazionale VISA sono stati disattivati per un giorno intero, e i dettagli dell'incidente non sono stati mai divulgati.

Giappone

Nell'estate del 2018, nei livelli sotterranei del centro dati Amazon in costruzione nella periferia di Tokyo, si è verificato un incendio che ha causato la morte di 5 lavoratori e ha ferito almeno 50. Il fuoco ha danneggiato circa 5000 m2 di locali della struttura. Le indagini hanno rivelato che la causa dell'incendio è stata il fattore umano: a causa di un uso imprudente di cannelli ad acetilene, si è incendiato l'isolamento.

Cause dei guasti

L'elenco degli incidenti fornito non è affatto esaustivo; a causa di guasti nei data center, i clienti delle banche e degli operatori di telecomunicazioni soffrono, i servizi dei fornitori di cloud vanno offline e addirittura il funzionamento dei servizi di emergenza viene compromesso. Un piccolo malfunzionamento può portare a gravi perdite, e, secondo i dati dell'Uptime Institute, la maggior parte dei guasti (39%) è legata al sistema di alimentazione elettrica. Al secondo posto (24%) c'è il fattore umano, e al terzo (15%) il sistema di condizionamento. Solo il 12% degli incidenti nei data center è attribuibile a fenomeni naturali, e solo il 10% di questi avviene per motivi diversi da quelli elencati.

Nonostante gli standard rigorosi di affidabilità e sicurezza, nessuna struttura è immune agli incidenti. La maggior parte di essi si verifica a causa di guasti di alimentazione o errori del personale. Questi due fattori dovrebbero ricevere la massima attenzione dai proprietari di data center e sale server; i clienti devono comprendere che anche i leader di mercato non possono garantire un'affidabilità assoluta. Se l'attrezzatura o il servizio cloud gestisce processi critici per il business, vale la pena considerare un sito di backup.

Fonte foto: telecombloger.ru

Fonte: habr.com

Acquista hosting affidabile per siti web con protezione DDoS, VPS VDS server 🔥 Acquista hosting affidabile per siti web con protezione DDoS, VPS VDS server | ProHoster