Grote incidenten in datacenters: oorzaken en gevolgen

Moderne datacenters zijn betrouwbaar, maar elke apparatuur kan af en toe kapotgaan. In een korte notitie hebben we de meest significante incidenten van 2018 verzameld.

Grote incidenten in datacenters: oorzaken en gevolgen

De invloed van digitale technologieĆ«n op de economie groeit, de hoeveelheid verwerkte informatie neemt toe, er worden nieuwe faciliteiten gebouwd, en dit is goed zolang alles functioneert. Helaas stijgt ook de impact van storingen in datacenters op de economie sinds mensen hun kritische IT-infrastructuur daaronder hebben geplaatst – dit is een onvermijdelijk gevolg van digitalisering. We publiceren een kleine selectie van de meest opvallende incidenten die vorig jaar in verschillende landen hebben plaatsgevonden.

de VS

Dit land is erkend als een leider op het gebied van datacenterbouw. In de Verenigde Staten zijn er de meeste grote commerciƫle en zakelijke datacenters, die wereldwijde diensten bedienen, waardoor de gevolgen van incidenten daar het grootst zijn. Begin maart ondervonden vier koppelingen van de operator Equinix storingen in het stroomvoorzieningssysteem door een krachtige tyfoon. De locaties werden gebruikt voor Amazon Web Services (AWS) apparatuur, en de storing leidde tot het onbereikbaar zijn van veel populaire diensten: GitHub, MongoDB, NewVoiceMedia, Slack, Zillow, Atlassian, Twilio en Capital One, evenals de virtuele assistent Amazon Alexa.

In september troffen weersanomalieƫn de datacenters van Microsoft in de staat Texas; een onweersbui leidde toen tot een storing in het stroomvoorzieningssysteem van een hele regio, en in het datacenter dat op dieselgeneratoren draaide, viel de koeling om onbekende redenen weg. Het kostte enkele dagen om de gevolgen van de storing op te lossen, en hoewel deze storing geen kritische impact had dankzij load balancing, merkten gebruikers over de hele wereld enige vertraging in de cloudservices van Microsoft op.

Rusland

Het ernstigste incident vond plaats op 20 augustus in een van de datacenters van Rostelecom. Als gevolg hiervan stopten de servers van het Enkel Nationaal Register van Vastgoed gedurende 66 uur, wat betekende dat ze naar een reservelocatie moesten worden verplaatst. Het was pas op 3 september dat Rosreestr de verwerking van binnenkomende aanvragen via alle kanalen kon herstellen – de overheidsorganisatie probeert een aanzienlijk bedrag van Rostelecom te vorderen vanwege schending van de service-level overeenkomst.

Op 16 februari schakelde het back-upvoedingssysteem van het datacenter van het bedrijf Xelnet (Sint-Petersburg) in vanwege problemen in de netwerken van Leningradenergo. De korte onderbreking van de sinusgolf leidde tot storingen in de werking van talrijke diensten: in het bijzonder werd een grote cloudprovider 1cloud getroffen, maar het meest opvallende probleem voor het Russische internetpubliek was de onmogelijkheid om de website van het sociale netwerk 'VKontakte' te openen. Het interessante is dat het ongeveer 12 uur duurde om de gevolgen van de korte stroomonderbreking volledig te verhelpen.

Europese Unie

In de EU werden in 2018 verschillende ernstige incidenten geregistreerd. In maart was er een storing in het datacenter van luchtvaartmaatschappij KLM: de stroomvoorziening viel 10 minuten uit en de capaciteit van de dieselgeneratoren was onvoldoende voor het functioneren van de apparatuur. Een deel servers werd uitgeschakeld, waardoor luchtvaartmaatschappijen tientallen vluchten moesten annuleren of verplaatsen.

Dit was niet het enige voorval met luchttransport – al in april vond er een storing plaats in het elektriciteitssysteem van het datacenter van Eurocontrol. Deze organisatie beheert het vliegtuigverkeer in de Europese Unie, en terwijl specialisten 5 uur bezig waren met het verhelpen van de gevolgen van het ongeval, moesten passagiers opnieuw wachten op vertragingen en herplanning van vluchten.

Zeer ernstige problemen ontstaan door storingen in datacenters die de financiƫle sector bedienen. De kosten van onderbrekingen in transacties zijn hier doorgaans hoog, en het betrouwbaarheidsniveau van deze objecten is overeenkomstig, maar dat voorkomt incidenten niet. Op 18 april kon de beurs Nordic NASDAQ (Helsinki, Finland) een gehele dag geen handel drijven in Noord-Europa wegens een ongeautoriseerde aktivering van het brandblussysteem in een commercieel datacenter van DigiPlex, dat noodgedwongen werd afgesloten.

Op 7 juni dwongen storingen in het datacenter de London Stock Exchange (LSE) om het begin van de handel een uur uit te stellen. Bovendien werden in juni de diensten van het internationale betalingsysteem VISA een hele dag uitgeschakeld in Europa als gevolg van een storing in een datacenter, waarbij de details van het incident niet openbaar zijn gemaakt.

Japan

In de zomer van 2018 brak er een brand uit in de ondergrondse niveaus van het in aanbouw zijnde datacenter van Amazon in de voorsteden van Tokio, waarbij 5 arbeiders omkwamen en minstens 50 gewond raakten. Het vuur beschadigde ongeveer 5000 m2 van het gebouw. Onderzoek heeft aangetoond dat de oorzaak van de brand een menselijke fout was: de isolatie vatte vlam door onzorgvuldig omgaan met acetyleenbranders.

Oorzaken van storingen

De gegeven lijst van incidenten is verre van volledig; door storingen in datacenters hebben klanten van banken en telecomoperatoren te lijden, online diensten van cloudproviders gaan offline en zelfs de werking van nooddiensten wordt verstoord. Een kleine onderbreking in de service kan leiden tot ernstige verliezen, terwijl volgens het Uptime Institute de meeste storingen (39%) samenhangen met de stroomvoorziening. Op de tweede plaats (24%) staat de menselijke factor, en op de derde plaats (15%) het airconditioningsysteem. Natuurlijke verschijnselen zijn goed voor slechts 12% van de incidenten in datacenters, en slechts 10% daarvan gebeurt om andere redenen dan hierboven vermeld.

Ondanks de strenge normen voor betrouwbaarheid en veiligheid zijn incidenten niet te voorkomen voor welk object dan ook. De meeste gebeuren door stroomuitval of fouten van personeel. Deze twee factoren verdienen vooral aandacht van eigenaren van datacenters en serverruimtes, terwijl opdrachtgevers moeten begrijpen: zelfs marktleiders kunnen absolute betrouwbaarheid niet garanderen. Als hardware of een cloudservice cruciale bedrijfsprocessen ondersteunt, is het raadzaam na te denken over een back-uplocatie.

Bron foto: telecombloger.ru

Bron: habr.com

Koop betrouwbare webhosting met bescherming tegen DDoS, VPS VDS servers šŸ”„ Koop betrouwbare webhosting met bescherming tegen DDoS, VPS VDS servers | ProHoster