Graves accidents dans les centres de données : causes et conséquences

Les centres de données modernes sont fiables, mais tout équipement peut tomber en panne de temps à autre. Dans cette brève note, nous avons rassemblé les incidents les plus significatifs de 2018.

Graves accidents dans les centres de données : causes et conséquences

L'influence des technologies numériques sur l'économie croît, les volumes d'informations traitées augmentent, de nouveaux objets sont construits, ce qui est positif tant que tout fonctionne. Malheureusement, l'impact des pannes dans les centres de données sur l'économie augmente également depuis que les entreprises ont commencé à y héberger une infrastructure informatique critique – tel est le résultat inévitable de la numérisation. Nous publions une petite sélection des incidents les plus notables survenus dans différents pays l'année dernière.

États-Unis

Ce pays est reconnu comme un leader dans le domaine de la construction de centres de données. Les États-Unis possèdent le plus grand nombre de grandes entreprises et de centres commerciaux des centres de données, fournissant des services globaux, ce qui rend les conséquences des incidents dans ces centres particulièrement importantes. Début mars, en raison d'un puissant cyclone, quatre installations de l'opérateur Equinix ont rencontré des pannes dans leur système d'alimentation électrique. Les espaces étaient utilisés pour l'équipement Amazon Web Services (AWS), et l'accident a conduit à l'inaccessibilité de nombreux services populaires : GitHub, MongoDB, NewVoiceMedia, Slack, Zillow, Atlassian, Twilio et Capital One, ainsi que l'assistant virtuel Amazon Alexa.

En septembre, des anomalies météorologiques ont frappé les centres de données de Microsoft situés au Texas, alors qu'une tempête avait interrompu le fonctionnement du système d'alimentation électrique d'une région entière, et dans un centre de données qui était passé à l'alimentation par générateur, le refroidissement s'est inexplicablement arrêté. La gestion des conséquences de l'accident a pris plusieurs jours, et bien que la répartition de la charge ait empêché que cette panne ne devienne critique, certains utilisateurs dans le monde entier ont noté un ralentissement des services cloud de Microsoft.

Russie

L'accident le plus grave a eu lieu le 20 août dans l'un des centres de données de Rostelecom. En raison de cet incident, les serveurs du Registre national des biens immobiliers ont été hors service pendant 66 heures, ce qui a nécessité leur transfert vers un site de secours. Le traitement des demandes entrantes par tous les canaux n'a pu être restauré par le Rosreestr qu'à partir du 3 septembre – l'organisation publique tente de réclamer une somme importante à Rostelecom pour violation du contrat de niveau de service.

Le 16 février, en raison de problèmes dans les réseaux de Lenenergo, le système d'alimentation électrique de secours du centre de données de l'entreprise Xelnet (Saint-Pétersbourg) a été activé. Une interruption brève du courant a causé des perturbations dans le fonctionnement de nombreux services : en particulier, un grand fournisseur de cloud, 1cloud, a été touché, mais le problème le plus visible pour le public Internet russe a été l'incapacité d'accéder au site du réseau social « VKontakte ». Fait intéressant, il a fallu environ 12 heures pour atténuer complètement les conséquences de cette brève panne de courant.

Union Européenne

En 2018, plusieurs incidents graves ont été signalés dans l'UE. En mars, un incident s'est produit dans le centre de données de la compagnie aérienne KLM : l'alimentation électrique a été coupée pendant 10 minutes, et la capacité des générateurs diesel s'est révélée insuffisante pour faire fonctionner le matériel. Une partie serveurs s'est éteinte, et la compagnie aérienne a dû annuler ou reporter plusieurs dizaines de vols.

Ce n'est pas le seul incident lié au transport aérien : en avril, un problème s'est produit dans le système d'alimentation électrique du centre de données Eurocontrol. L'organisation gère le trafic aérien dans l'Union Européenne, et pendant que les spécialistes passaient 5 heures à réparer les conséquences de l'accident, les passagers ont de nouveau dû faire face à des retards et à des reports de vols.

Des problèmes très sérieux surviennent en raison d'accidents dans les centres de données qui desservent le secteur financier. Les coûts des interruptions dans les transactions y sont généralement élevés, et le niveau de fiabilité des installations est adéquat, mais cela ne prévient pas les incidents. Le 18 avril, la bourse de valeurs Nordic NASDAQ (Helsinki, Finlande) n'a pas pu effectuer de transactions dans toute l'Europe du Nord pendant une journée à cause du déclenchement non autorisé du système de lutte contre l'incendie à gaz dans le centre de données commercial DigiPlex, qui a été mis hors service.

Le 7 juin, des interruptions dans le fonctionnement du centre de données ont obligé la bourse de Londres (London Stock Exchange, LSE) à retarder le début des transactions d'une heure. De plus, en juin, en Europe, des services du système de paiement international VISA ont été coupés pendant toute une journée à cause d'une panne dans un centre de données, et les détails de l'incident n'ont jamais été divulgués.

Japon

L'été 2018, un incendie s'est déclaré dans les niveaux souterrains d'un centre de données Amazon en construction en banlieue de Tokyo, causant la mort de 5 travailleurs et des blessures à au moins 50 autres. Le feu a endommagé environ 5000 m² des locaux de l'installation. L'enquête a révélé que la cause de l'incendie était humaine : une isolation a pris feu en raison d'une utilisation imprudente des torches à acétylène.

Causes des pannes

La liste des incidents fournie est loin d'être exhaustive ; en raison des pannes dans les centres de données, les clients des banques et des opérateurs de télécommunications sont affectés, les services des fournisseurs de cloud sont mis hors ligne, et même le fonctionnement des services d'urgence est perturbé. Une petite interruption de service peut entraîner des pertes importantes, tandis que selon l'Uptime Institute, la majorité des défaillances (39 %) sont liées au système d'alimentation électrique. En deuxième position (24 %), on trouve le facteur humain, et en troisième position (15 %), le système de climatisation. Les phénomènes naturels représentent seulement 12 % des incidents dans les centres de données, et seulement 10 % d'entre eux se produisent pour d'autres raisons.

Malgré des normes strictes de fiabilité et de sécurité, aucun site n'est à l'abri des incidents. La plupart d'entre eux se produisent en raison de pannes de courant ou d'erreurs humaines. Ces deux facteurs devraient être la priorité pour les propriétaires de centres de données et de salles de serveurs, tandis que les clients doivent comprendre : même les leaders du marché ne peuvent garantir une fiabilité absolue. Si le matériel ou le service cloud gère des processus critiques pour l'entreprise, il convient d'envisager un site de secours.

Source de la photo : telecombloger.ru

Source : habr.com

Acheter un hébergement fiable pour les sites avec protection DDoS, serveurs VPS VDS 🔥 Acheter un hébergement fiable pour les sites avec protection DDoS, serveurs VPS VDS | ProHoster