Grandi incidenti nei data center: cause e conseguenze

I data center moderni sono affidabili, ma qualsiasi attrezzatura può guastarsi di tanto in tanto. In questa breve nota abbiamo raccolto i più significativi incidenti del 2018.

Grandi incidenti nei data center: cause e conseguenze

L'impatto delle tecnologie digitali sull'economia cresce, aumentando i volumi di informazioni trattate, e vengono costruiti nuovi impianti, il che è positivo finché tutto funziona. Sfortunatamente, l'effetto dei malfunzionamenti nei data center sull'economia sta aumentando, da quando le aziende hanno iniziato a ospitare infrastrutture IT critiche per il business – è una conseguenza inevitabile della digitalizzazione. Pubblicizziamo una piccola selezione degli incidenti più significativi che si sono verificati in diversi paesi lo scorso anno.

Stati Uniti

Questo paese è un riconosciuto leader nel settore della costruzione di data center. Negli Stati Uniti si trovano il maggior numero di grandi servizi commerciali e aziendali centri di elaborazione dati, che forniscono servizi globali, quindi le conseguenze degli incidenti in essi sono le più significative. All'inizio di marzo, a causa di un potente ciclone, quattro impianti dell'operatore Equinix hanno subito interruzioni del sistema di alimentazione. Gli spazi erano utilizzati per l'equipaggiamento di Amazon Web Services (AWS), e l'incidente ha portato all'inaccessibilità di molti servizi popolari: hanno subito danni GitHub, MongoDB, NewVoiceMedia, Slack, Zillow, Atlassian, Twilio e Capital One, oltre all'assistente virtuale Amazon Alexa.

A settembre, anomalie climatiche hanno colpito i data center Microsoft situati in Texas; a causa di un temporale, il sistema di alimentazione di un'intera regione è stato interrotto, e nel data center passato all'alimentazione da generatori di emergenza, il raffreddamento si è spento per motivi sconosciuti. Ci sono voluti diversi giorni per riparare i danni; e sebbene grazie all'equilibrio del carico questo guasto non sia stato critico, alcuni utenti in tutto il mondo hanno notato un rallentamento nei servizi cloud di Microsoft.

Russia

L'incidente più grave si è verificato il 20 agosto in uno dei data center di Rostelecom. A causa di esso, i server del Registro Unico Statale degli Immobili sono stati fermi per 66 ore, e questo ha comportato il loro trasferimento in un sito di riserva. Il trattamento delle domande ricevute tramite tutti i canali è stato ripristinato solo il 3 settembre – l'organizzazione pubblica sta cercando di richiedere a Rostelecom una somma considerevole per la violazione del contratto di livello di servizio.

Il 16 febbraio, a causa di problemi nelle reti di Lenenergo, si è attivato il sistema di alimentazione di emergenza nel data center della compagnia Xelnet (San Pietroburgo). Una breve interruzione della sinusoide ha causato malfunzionamenti in molti servizi: ha colpito, in particolare, un grande provider cloud, 1cloud, ma il problema più evidente per il pubblico internet russo è stato l'impossibilità di accedere al sito del social network "VKontakte". L'aspetto più interessante è che per riparare completamente i danni dopo questa breve interruzione dell'alimentazione sono state necessarie circa 12 ore.

Unione Europea

Nell'UE, nel 2018, sono stati registrati diversi gravi incidenti. A marzo, c'è stato un guasto nel data center della compagnia aerea KLM: l'alimentazione elettrica è stata interrotta per 10 minuti e la potenza delle installazioni di generatori diesel si è rivelata insufficiente per far funzionare l'attrezzatura. Parte server dell'equipaggiamento si è spento, e le compagnie aeree hanno dovuto cancellare o riprogrammare diverse decine di voli.

Questo non è l'unico incidente legato ai trasporti aerei: già ad aprile si è verificato un guasto nel sistema di alimentazione del data center Eurocontrol. L'organizzazione gestisce il traffico aereo nell'Unione Europea, e mentre gli specialisti hanno impiegato 5 ore per riparare i danni, i passeggeri hanno di nuovo dovuto sopportare ritardi e riprogrammazioni dei voli.

Problemi molto gravi sorgono a causa di incidenti nei data center che servono il settore finanziario. Il costo delle interruzioni nelle transazioni qui è solitamente elevato, e il livello di affidabilità delle strutture è corrispondente, ma gli incidenti non possono essere evitati. Il 18 aprile, la borsa valori Nordic NASDAQ (Helsinki, Finlandia) non ha potuto effettuare scambi in tutta la Scandinavia per un giorno a causa di un avvio non autorizzato del sistema di spegnimento a gas in un data center commerciale di DigiPlex, che è stato disalimentato.

Il 7 giugno, i guasti nei data center hanno costretto la London Stock Exchange (LSE) a posticipare l'inizio delle negoziazioni di un'ora. Inoltre, a giugno, in Europa, i servizi del sistema di pagamento internazionale VISA sono stati interrotti per un'intera giornata a causa di un guasto in un data center, di cui i dettagli dell'incidente non sono stati mai divulgati.

Giappone

Nell'estate del 2018, nei livelli sotterranei del data center Amazon in fase di costruzione nei dintorni di Tokyo, è scoppiato un incendio che ha causato la morte di 5 operai e ha ferito almeno 50 persone. Il fuoco ha danneggiato circa 5000 m² di spazi dell'impianto. Le indagini hanno rivelato che la causa dell'incendio è stata un errore umano: l'isolamento è andato a fuoco a causa di un uso imprudente di torce ad acetilene.

Cause dei guasti

L'elenco fornito di incidenti è tutt'altro che esaustivo, poiché a causa di incidenti nei data center risentono i clienti delle banche e degli operatori di telecomunicazioni, i servizi dei provider cloud vanno offline e persino il funzionamento dei servizi di emergenza è compromesso. Un piccolo interruzione del servizio può portare a perdite significative; secondo i dati dell'Uptime Institute, la maggior parte dei guasti (39%) è legata al sistema di alimentazione elettrica. Al secondo posto (24%) c'è il fattore umano e al terzo (15%) si trova il sistema di condizionamento. Solo il 12% degli incidenti nei data center può essere attribuito a fenomeni naturali, e solo il 10% di questi avviene per cause diverse da quelle elencate.

Nonostante gli standard rigorosi di affidabilità e sicurezza, nessun impianto è immune da incidenti. La maggior parte di essi è causata da guasti di alimentazione elettrica o errori del personale. Questi due fattori dovrebbero essere la priorità per i proprietari di data center e sale server, e i clienti devono comprendere: anche i leader di mercato non possono garantire affidabilità assoluta. Se le attrezzature o i servizi cloud gestiscono processi critici per il business, è opportuno considerare un sito di backup.

Fonte foto: telecombloger.ru

Fonte: habr.com

Acquista hosting affidabile per siti web con protezione DDoS, server VPS VDS 🔥 Acquista hosting affidabile per siti web con protezione DDoS, server VPS VDS | ProHoster