Tolerancia a fallos en los sistemas de almacenamiento Qsan

Hoy en la infraestructura de TI, con el uso generalizado de la virtualización, los sistemas de almacenamiento de datos son el núcleo que almacena todas las máquinas virtuales. El fallo de este nodo puede detener por completo el funcionamiento del centro de cómputo. Aunque una parte considerable de los equipos de servidores tiene tolerancia a fallos de una forma u otra "por defecto", precisamente debido al papel especial de los sistemas de almacenamiento dentro de un centro de datos, se les imponen mayores requisitos en términos de "supervivencia".

Tolerancia a fallos en los sistemas de almacenamiento Qsan

El método más eficaz para garantizar la tolerancia a fallos en TI es utilizar múltiples copias de equipos y software (en el caso más simple, duplicación). Por supuesto, el sistema de almacenamiento se puede duplicar por completo. Y para la recuperación ante desastres este es exactamente el enfoque que se utiliza. Pero no todas las empresas pueden permitirse una solución de este tipo. No estamos hablando sólo del doble del costo del equipo, sino también de otros costos de organizar una solución de este tipo y su soporte adicional.

Sin embargo, la capacidad de duplicar equipos no reemplaza la necesidad de proporcionar tolerancia a fallas a nivel de componente. En particular, el sistema de almacenamiento utiliza redundancia para fuentes de alimentación, módulos de refrigeración, unidades y, por supuesto, controladores. Todo esto se ha convertido desde hace mucho tiempo en algo común. Es difícil encontrar sistemas de almacenamiento sin utilizar un diseño similar. qsan Aquí no hay excepción. Pero en este artículo queremos hablar de algo que no es inmediatamente obvio y que, al mismo tiempo, tiene como objetivo principal aumentar la tolerancia a fallos del sistema en su conjunto.

Módulos de refrigeración

Muy a menudo en Almacenamiento con cajas 2U-3U se utilizan módulos combinados que combinan fuentes de alimentación y ventiladores. Por un lado, esto es conveniente, porque... Sólo es necesario reparar un bloque. Por otro lado, si el sistema de refrigeración falla, se puede forzar el corte del suministro eléctrico para evitar el sobrecalentamiento. Y no parece que vaya a surgir la situación más crítica, pero claramente no merece la pena añadir vulnerabilidades al sistema de almacenamiento.

La refrigeración en los sistemas de almacenamiento Qsan se organiza en forma de módulos separados intercambiables en caliente, independientes de las fuentes de alimentación. En realidad, las fuentes de alimentación tienen sus propios ventiladores diseñados para soplar aire sobre las propias fuentes de alimentación. El módulo de refrigeración contiene dos ventiladores independientes que se protegen entre sí. Hay dos módulos de este tipo en el sistema de almacenamiento: a la derecha y a la izquierda, para un flujo de aire eficaz de todos los componentes. Si uno de los ventiladores falla, todos los demás aumentan automáticamente su velocidad para compensar la falta de flujo de aire resultante. Por eso, un mal funcionamiento del ventilador no conlleva riesgo de sobrecalentamiento de todo el dispositivo.

Topología de conexión del estante de expansión

Diagrama de conexión clásico estantes de expansión El almacenamiento implica una topología llamada cascada. En este caso, los controladores de estantería y los sistemas de almacenamiento correspondientes están conectados entre sí mediante un único cable SAS. Esto da como resultado 2 cables para un sistema de dos controladores. Si necesita conectar un segundo estante, se conecta de la misma manera al primer estante. Etcétera. La ventaja de esta topología es la facilidad de implementación en equipos. La desventaja será cierta vulnerabilidad a una interrupción repentina en la cadena SAS debido a una falla cruzada de los controladores de almacenamiento desconectados y el estante o debido a la pérdida de energía en uno de los estantes de expansión en el medio de la cadena. El resultado será la pérdida de acceso a algunas de las unidades y un posible colapso del grupo RAID si se “distribuye” en varios gabinetes.

Qsan tiene protección contra fallas cruzadas de los controladores en forma de una conexión lógica interna de los controladores a través del backplane de almacenamiento. Aquellos. El controlador de almacenamiento no solo ve el controlador JBOD conectado directamente a él, sino también el controlador "vecino" a través de un enlace especial en el backplane. Como resultado, si se produce una situación de este tipo y nadie desconecta físicamente los cables SAS entre el sistema de almacenamiento y el estante, se conservará el acceso a todas las unidades.

Tolerancia a fallos en los sistemas de almacenamiento Qsan

Para protegerse contra una interrupción en el circuito SAS, por ejemplo, debido a una pérdida de energía en un estante de expansión, generalmente se usa una topología de conexión diferente: una cascada inversa. En este caso, el sistema de almacenamiento se conecta directamente al primer y último estante de la cadena, teniendo acceso a los accionamientos por ambos lados.

Tolerancia a fallos en los sistemas de almacenamiento Qsan

Si desea una protección más sólida, puede crear configuraciones más grandes utilizando, por ejemplo, una topología de árbol. O hacerlo aún más complicado combinando las topologías mencionadas. Esto es posible gracias a la gran cantidad de conectores SAS en los dispositivos (2 para cada controladora de almacenamiento y 5 para cada controladora JBOD) con detección automática de modos de funcionamiento de entrada/salida. Lo principal es que el propio administrador no se confunde. Y el sistema de almacenamiento podrá realizar la configuración correctamente.

Reconstrucción rápida

La presencia de discos de repuesto dinámicos en el sistema aumenta significativamente la confiabilidad del almacenamiento de información. Sin embargo, el simple hecho de que dichos discos estén asignados no significa una protección absoluta. El hecho es que el proceso de recuperación requiere bastante mano de obra y, a menudo, requiere mucho tiempo. La intensidad de la mano de obra proviene del acceso incesante a los datos maestros. Aquellos. El sistema, junto con su trabajo actual, también debe copiar datos a un disco nuevo. Y la duración de la reconstrucción depende directamente de la capacidad de almacenamiento y sus características de velocidad. Dado que el sistema no sabe nada sobre el espacio en disco realmente ocupado, durante el proceso de reconstrucción simplemente copia todo: bloque por bloque.

Como resultado, restaurar un disco moderno de alta capacidad de más de 10 TB bajo una carga de almacenamiento severa puede llevar fácilmente una semana o más. También debe tenerse en cuenta el hecho de que durante la reconstrucción, la probabilidad de falla de otras unidades aumenta significativamente debido al aumento de carga sobre ellas. Y esto ya puede suponer un grave peligro si, por ejemplo, se utiliza RAID5.

Como solución a este problema, muchos desarrolladores de sistemas de almacenamiento se preocupan por acelerar el proceso de recuperación. Se pueden utilizar diferentes enfoques para esto, pero la esencia es la misma: copiar solo los bloques realmente ocupados durante la reconstrucción. Qsan tampoco permaneció al margen de este problema. El sistema de almacenamiento de este proveedor con la opción activada Reconstrucción rápida el sistema rastrea los bloques utilizados para la grabación, por lo que tiene la capacidad, en caso de falla del disco, de copiarlos solo a una nueva unidad.

Tolerancia a fallos en los sistemas de almacenamiento Qsan

La opción Reconstrucción rápida no está habilitada de forma predeterminada al crear nuevos volúmenes, porque... su uso tiene un impacto en el rendimiento, especialmente en operaciones de escritura aleatoria, porque:

  1. Es necesario realizar un seguimiento de los registros en bloques;
  2. Durante una reconstrucción, las sumas de comprobación del espacio no asignado no se vuelven a calcular, por lo que cuando escribe una nueva entrada en esta área, primero debe "inicializarla".

Por lo tanto, no se recomienda utilizar Fast Rebuild para volúmenes, por ejemplo, con bases de datos muy cargadas o en sistemas de videovigilancia, donde el volumen terminará lleno al 100%. Pero para servidores de archivos o correo, esta opción será muy útil.

En lugar de una conclusión

Todo fabricante de sistemas de almacenamiento asume que sus dispositivos son fiables. Y si no hay errores de cálculo fatales en el desarrollo de dispositivos y un increíble deseo de ahorrar en el proceso de producción y prueba, entonces, en general, podemos estar de acuerdo con el proveedor. Sin embargo, es necesario comprender:

  • la tolerancia a fallos del sistema de almacenamiento básico es, ante todo, una forma de seguir teniendo acceso a los datos en caso de fallo de cualquier componente;
  • opciones adicionales de tolerancia a fallas (como las descritas anteriormente): esto elimina algunos tipos de fallas y aumenta sus posibilidades de tener acceso a los datos;
  • Desafortunadamente, no existe el 100% de confiabilidad. Pero, para acercarse lo más posible a esto, la mayoría de los proveedores de sistemas de almacenamiento sensatos (y qsan entre ellos) hacen todo lo posible para mejorar continuamente sus productos tanto en hardware como en software.

Al mismo tiempo, no debemos olvidar que la confiabilidad absoluta de los sistemas de almacenamiento no puede negar la disponibilidad de copias de seguridad, planes de recuperación claros y ensayados en caso de desastre y soporte técnico rápido por parte del proveedor.

Fuente: habr.com

Compre alojamiento confiable para sitios con protección DDoS, servidores VPS VDS 🔥 Compra alojamiento web fiable con protección DDoS, servidores VPS VDS | ProHoster