Los centros de datos modernos son confiables, sin embargo, cualquier equipo puede fallar de vez en cuando. En un breve artículo, hemos recopilado los incidentes más significativos del año 2018.

El impacto de las tecnologías digitales en la economía está en crecimiento, aumentando los volúmenes de información procesada, se construyen nuevos edificios, y esto es bueno, mientras todo funcione. Desafortunadamente, el impacto de las fallas en los centros de datos sobre la economía también aumenta desde que las empresas comenzaron a desplegar infraestructura IT crítica en ellos; tal es la inevitable consecuencia de la digitalización. Publicamos una pequeña selección de los incidentes más notables ocurridos en diferentes países el año pasado.
EE. UU.
Este país es un reconocido líder en la construcción de centros de datos. En Estados Unidos hay más centros comerciales y corporativos importantes centros de procesamiento de datos, que sirven servicios globales, por lo que las consecuencias de los incidentes en ellos son las más significativas. A principios de marzo, debido a un poderoso ciclón, cuatro instalaciones del operador Equinix enfrentaron fallas en el sistema de suministro eléctrico. Las instalaciones se utilizaban para el equipamiento de Amazon Web Services (AWS), y la falla causó la indisponibilidad de muchos servicios populares: afectó a GitHub, MongoDB, NewVoiceMedia, Slack, Zillow, Atlassian, Twilio y Capital One, así como al asistente virtual Amazon Alexa.
En septiembre, anomalías climáticas golpearon a los centros de datos de Microsoft en Texas, donde una tormenta interrumpió el funcionamiento del sistema eléctrico de toda una región, y en el centro de datos que pasó a funcionar con generadores diésel, inexplicablemente se apagó el sistema de enfriamiento. La recuperación de los efectos de la falla tomó varios días, y aunque gracias a la carga equilibrada esta disfunción no fue crítica, algunos usuarios de servicios en la nube de Microsoft notaron cierta lentitud en el funcionamiento a nivel mundial.
Rusia
La falla más grave ocurrió el 20 de agosto en uno de los centros de datos de Rostelecom. Debido a esto, los servidores del Registro Único Estatal de Propiedades se detuvieron durante 66 horas, por lo que tuvieron que ser trasladados a una ubicación de respaldo. La recuperación del procesamiento de las solicitudes entrantes por todos los canales fue posible solo el 3 de septiembre; la organización estatal intenta reclamar a Rostelecom una suma considerable por la violación del acuerdo de nivel de servicio.
El 16 de febrero, debido a problemas en las redes de Lenenergo, se activó el sistema de suministro eléctrico de respaldo en el centro de datos de la empresa Xelnet (San Petersburgo). La interrupción temporal de la sinusoidal causó fallas en el funcionamiento de numerosos servicios: en particular, se vio afectado el importante proveedor de nube 1cloud, pero el problema más notable para la audiencia de Internet rusa fue la imposibilidad de acceder al sitio de la red social «VKontakte». Lo más interesante es que la eliminación completa de las consecuencias de la breve falla de energía tomó alrededor de 12 horas.
Unión Europea
En la UE, se registraron varios incidentes graves en 2018. En marzo, hubo una falla en el centro de datos de la aerolínea KLM: el suministro de electricidad se interrumpió durante 10 minutos, y la capacidad de las unidades de generadores diésel resultó insuficiente para operar el equipo. Parte servidores se desconectaron, y la aerolínea tuvo que cancelar o reprogramar varios docenas de vuelos.
Este no fue el único incidente relacionado con el transporte aéreo; ya en abril, se produjo una falla en el sistema de suministro eléctrico del centro de datos de Eurocontrol. La organización gestiona el tráfico aéreo en la Unión Europea, y mientras los especialistas trabajaban durante 5 horas para solucionar las consecuencias del accidente, los pasajeros nuevamente tuvieron que soportar retrasos y cambios en los vuelos.
Los problemas muy serios surgen debido a fallas en los centros de datos que sirven al sector financiero. El costo de las interrupciones en las transacciones suele ser alto, y el nivel de fiabilidad de las instalaciones es correspondiente, pero esto no previene los incidentes. El 18 de abril, la bolsa de valores Nordic NASDAQ (Helsinki, Finlandia) no pudo realizar transacciones en toda el norte de Europa durante un día debido a la activación no autorizada del sistema de extinción de incendios en el centro de datos comercial DigiPlex, que fue desenergizado de emergencia.
El 7 de junio, las interrupciones en el funcionamiento del centro de datos obligaron a la bolsa de valores de Londres (London Stock Exchange, LSE) a retrasar el inicio de las operaciones durante una hora. Además, en junio, en Europa, debido a una falla en el centro de datos, los servicios del sistema de pagos internacional VISA se desconectaron durante todo un día, y los detalles del incidente no han sido divulgados.
Japón
En el verano de 2018, un incendio ocurrió en los niveles subterráneos de un centro de datos de Amazon en construcción en las afueras de Tokio, resultando en la muerte de 5 trabajadores y al menos 50 heridos. El fuego dañó aproximadamente 5000 m2 de las instalaciones del objeto. La investigación reveló que la causa del incendio fue el factor humano: la inflamación del aislamiento debido al manejo imprudente de antorchas de acetileno.
Causas de fallos
La lista de incidentes presentada está lejos de estar completa, ya que los clientes de bancos y operadores de telecomunicaciones sufren por las averías en los centros de datos, los servicios de proveedores de nube se desconectan, e incluso el funcionamiento de los servicios de emergencia se interrumpe. Un pequeño corte en el servicio puede llevar a pérdidas significativas; según datos del Uptime Institute, la mayoría de los fallos (39%) están relacionados con el sistema de suministro eléctrico. En segundo lugar (24%) se encuentra el factor humano, y en tercero (15%) el sistema de aire acondicionado. Solo el 12% de los accidentes en centros de datos se atribuyen a fenómenos naturales, y solo el 10% de ellos ocurren por razones distintas a las mencionadas.
A pesar de los estrictos estándares de fiabilidad y seguridad, ningún objeto está libre de incidentes. La mayor parte de estos ocurre debido a fallos en la alimentación eléctrica o errores del personal. Estos dos factores son los que deben tener en cuenta, en primer lugar, los propietarios de centros de datos y salas de servidores, y los clientes deben comprender que incluso los líderes del mercado no pueden garantizar una fiabilidad absoluta. Si el equipo o el servicio en la nube gestionan procesos críticos para el negocio, es recomendable considerar un sitio de respaldo.
Fuente de la foto: telecombloger.ru
Fuente: habr.com
