Monitoreo en el centro de datos: cómo cambiamos nuestro antiguo BMS por uno nuevo. Parte 3

Continuamos nuestra historia sobre cómo cambiamos el sistema BMS en nuestros centros de datos (parte 1, parte 2). No solo cambiamos una solución de un proveedor por otra, sino que desarrollamos un sistema desde cero según nuestras necesidades. Como conclusión de nuestra historia, compartimos los resultados del trabajo realizado y soluciones interesantes que pueden ser útiles para usted.

Nueva interfaz

Aquí, como se dice, es mejor verlo una vez.

Monitoreo en el centro de datos: cómo cambiamos nuestro antiguo BMS por uno nuevo. Parte 3Estructuras.

Analicemos las diferencias.

  • En primer lugar, esto es hermoso cómodo. Preste atención a lo fácil que se ha vuelto monitorear las cargas en los módulos (“Banks” o simplemente “Bancos”) PDU y la suma de las cargas paralelas de los módulos emparejados. En el modelo de estante del nuevo BMS, vemos de inmediato que los módulos inferiores emparejados PDU están sobrecargados (la corriente total supera los 16A permitidos – notificación “azul”), mientras que los superiores están subcargados. En caso de desconexión de una de las entradas, toda la carga se trasladará a la segunda, y el módulo inferior que queda bajo tensión se apagará debido a la sobrecarga. Para evitar esto, el servicio de soporte del centro de datos advertirá al cliente con anticipación y enviará recomendaciones sobre cómo redistribuir la carga.
  • Adición simple de equipos. En el nuevo BMS, los sensores virtuales que suman las corrientes de los módulos y la potencia del estante ya están incluidos en las plantillas de estantes estándar y se crean automáticamente después de añadirlos al PDU. En el antiguo BMS, era necesario crearlos manualmente y luego arrastrarlos al mapa, lo que aumentaba la probabilidad de error debido al “factor humano”.
  • Infinito espacio para la creatividad. Ahora no tenemos restricciones al crear sensores virtuales. Se pueden construir modelos matemáticos de cualquier variable. Esto significa que tenemos la capacidad de crear sensores virtuales complejos (antes solo se podían sumar valores) y analizar mejor las estadísticas y tendencias del funcionamiento de los sistemas de ingeniería. Esto mejora la calidad de las decisiones tomadas sobre la configuración de los sistemas, el reemplazo de equipos y la gestión de recursos. 
  • Interfaz intuitiva. En la nueva interfaz no hay saturación de íconos, los ventiladores giran, los interruptores ‘clican’. Y lo más conveniente es la posibilidad de indicación del estado PDU Línea A/B dentro de los estantes. Intentamos hacer algo similar en el antiguo BMS, pero la cantidad de íconos fusionándose por centímetro cuadrado del mapa nos llevó a renunciar a ello.

Ahora es un placer para la vista:

Monitoreo en el centro de datos: cómo cambiamos nuestro antiguo BMS por uno nuevo. Parte 3
Servidores.

Monitoreo en el centro de datos: cómo cambiamos nuestro antiguo BMS por uno nuevo. Parte 3
Fragmento de RMU.

Monitoreo en el centro de datos: cómo cambiamos nuestro antiguo BMS por uno nuevo. Parte 3
Panel de control de ventilación.

Además, se puede decorar el nuevo BMS para el Año Nuevo 🙂
Monitoreo en el centro de datos: cómo cambiamos nuestro antiguo BMS por uno nuevo. Parte 3

One page – entendimiento mutuo con pocas palabras y sin TZ

Hemos querido desde hace mucho tiempo implementar otra "característica" en el BMS: compilar en una sola página los parámetros principales del centro de datos, de modo que con solo mirar la pantalla, se pueda evaluar el estado de los sistemas principales. Sin embargo, no acabábamos de entender cómo debería verse.

Incluso antes de comenzar el desarrollo del nuevo BMS, visitamos con tours alrededor de una docena de centros de datos en los Países Bajos. Uno de los objetivos era ver ejemplos de la implementación de dicha página.

Y en ninguno de los centros de datos nos la mostraron: en algunos no existía, en otros "estamos desarrollándola en este momento", en otros era "un gran secreto comercial". Por lo tanto, en nuestro TZ para la creación del nuevo BMS faltaba una descripción precisa de esta página que es muy importante para nosotros.

Al final, la ideamos literalmente "en el acto". Justo en ese momento tuve que asesorar a mis colegas en el centro de datos de forma remota. Pasar las páginas del BMS en el teléfono en busca de datos dispares era muy incómodo, y, de hecho, la primera versión fue esbozada en una servilleta. One page. Los desarrolladores la implementaron según la foto. 

Siguiendo el ejemplo de los cautelosos colegas holandeses, no mostraremos la versión final de nuestra página principal, especialmente porque cada centro de datos es único y no tiene sentido copiar. Pero podemos describir dos principios principales de su formación:

  1. Es una tabla diseñada para un formato de pantalla vertical de smartphone (o monitor, pero manteniendo la orientación vertical), mostrando toda la información importante en una sola pantalla. Encima de la tabla se presenta un "resumen" de incidentes activos, por lo que resulta más conveniente colocarlos juntos en formato vertical. 
  2. La disposición de las celdas en la tabla replica la arquitectura del centro de datos (física o lógica). Decidimos no organizar los sistemas en orden alfabético, como podría parecer a primera vista. La secuencia refleja las asociaciones visuales del personal del centro de datos, como si estuvieran monitoreando físicamente todas las salas y sistemas. Esto facilita la búsqueda de información.

En esencia, ahora todas las características clave del centro de datos están agrupadas y presentadas en una sola pantalla del smartphone / monitor del ingeniero responsable y del gerente, con un vínculo a la topografía física y lógica del centro de datos. 

Aquí está la foto del primer borrador, aunque, por supuesto, luego esta versión fue revisada y mejorada.

Monitoreo en el centro de datos: cómo cambiamos nuestro antiguo BMS por uno nuevo. Parte 3

Confirmación y resumen de incidentes

Hablaremos de otro concepto nuevo para nosotros, que surgió como resultado del proyecto de actualización del sistema de monitoreo.

La confirmación es un término bastante raro que propuso utilizar el desarrollador de la nueva BMS. Significa la confirmación de que el operador vio el incidente, lo confirmó y asumió la responsabilidad de resolverlo.  

La palabra se ha afianzado, y ahora «confirmamos» los incidentes.

El algoritmo incorporado en la versión básica de la nueva BMS no nos satisfizo. De hecho, eran comentarios en el registro de eventos, es decir, los incidentes resueltos no desaparecían del registro, y los aceptados («confirmados») no se distinguían de los nuevos.

Como resultado, se desarrolló una ventana llamada «resumen», en la que:

  1. Se muestran solo incidentes activos y dispositivos en modo de servicio (sin notificaciones comerciales «azules»).
  2. Se separan claramente los incidentes NUEVOS y los ACEPTADOS.
  3. Se indica quién aceptó el incidente.

El algoritmo de trabajo de los turnos en la nueva BMS es el siguiente:

  1. Los nuevos incidentes ingresan al resumen y esperan confirmación. No pueden estar en esta sección por mucho tiempo, el responsable del equipo debe aceptar el incidente de inmediato.
  2. El empleado acepta el incidente haciendo clic en la casilla de verificación a la derecha. Dado que todos los empleados tienen cuentas únicas, se muestra automáticamente quién aceptó el incidente. Si es necesario, se deja un comentario.
  3. El incidente se mueve a la sección «Confirmados», y los demás de turno y el gerente entienden que el incidente está siendo manejado por el empleado responsable.

Monitoreo en el centro de datos: cómo cambiamos nuestro antiguo BMS por uno nuevo. Parte 3
Ejemplo de la ventana de resumen con un mensaje nuevo y ya confirmado.

Al combinar la ventana de resumen con la tabla de Una página, obtuvimos una pantalla principal completa del sistema BMS, en la que se puede ver de inmediato: el estado de los sistemas principales del centro de datos; 

  • la existencia de nuevos incidentes no procesados;
  • la existencia de incidentes aceptados y datos sobre quién los está resolviendo específicamente.
  • наличие принятых инцидентов и данные о том, кто конкретно их устраняет.

Acceso a través del navegador y notificaciones emergentes en el teléfono.

La interfaz web, accesible desde cualquier dispositivo en cualquier parte del mundo, es un contraste radical con el cliente «grueso», completamente cerrado a los usuarios externos. 

El enfoque antiguo conllevaba una serie de inconvenientes, desde problemas en la organización del trabajo remoto del personal de monitoreo hasta la necesidad de instalar clientes «gruesos» desde distribuciones en los puestos de trabajo del personal en el centro de datos.

Ahora, cada página en BMS tiene una dirección única, lo que permite compartir no solo la dirección directa de la página o el dispositivo, sino también enlaces a gráficos/informes únicos. 

El acceso al sistema ahora se realiza mediante autenticación LDAP a través de Active Directory, lo que refuerza su nivel de seguridad. 

La movilidad hoy en día es un factor clave para el trabajo eficiente de los ingenieros de guardia. Además del control de monitoreo en la sala de guardia, los ingenieros realizan rondas, llevan a cabo trabajos ocasionales fuera de la «guardia» y, gracias a la pantalla principal de BMS optimizada para pantallas móviles, no pierden el control de lo que sucede en las salas de máquinas ni por un segundo. 

La calidad del control también mejora gracias a la funcionalidad de los chats de trabajo. Estos aceleran los procesos laborales, permitiendo «atar» la comunicación de los ingenieros de guardia a BMS. Por ejemplo, utilizamos la aplicación Teams, que permite mantener la comunicación interna y recibir en el teléfono todos los mensajes de BMS como notificaciones emergentes Push, lo que libera al ingeniero de guardia de la necesidad de estar mirando constantemente la pantalla del teléfono.

Monitoreo en el centro de datos: cómo cambiamos nuestro antiguo BMS por uno nuevo. Parte 3
 Notificación Push en la pantalla del smartphone.

Monitoreo en el centro de datos: cómo cambiamos nuestro antiguo BMS por uno nuevo. Parte 3
Así es como se ven las notificaciones en la aplicación Teams.

Además, las notificaciones emergentes están configuradas solo para mensajes sobre la aparición de incidentes, minimizando así los factores distractores; el personal sabe que si aparece una notificación Push de Teams en la pantalla del smartphone, debe ingresar a la página de BMS y aceptar el incidente. Los mensajes sobre la resolución de incidentes ya se rastrean en la página de BMS.

Monitoreo en el centro de datos: cómo cambiamos nuestro antiguo BMS por uno nuevo. Parte 3
En la foto, la interfaz de BMS en el smartphone.

Resumiendo

Con el costo de actualización de BMS de nuestro antiguo proveedor, comparable al desarrollo de un nuevo sistema desde cero (alrededor de $100,000), la diferencia en funcionalidad de los productos resultó colosal. Obtuvimos un sistema flexible, optimizado para nuestras tareas y procesos comerciales. También logramos un ahorro significativo en los gastos actuales de soporte y actualización del sistema. 

Pero, por supuesto, hubo dificultades. 

  • En primer lugar, subestimamos la cantidad de cambios que se requería hacer en la versión base del nuevo BMS y no cumplimos con los plazos previamente acordados. Esto no fue un problema crítico para nosotros, ya que siempre tuvimos una reserva y trabajamos en el viejo sistema, y el proceso fue creativo, complicado y a veces avanzó más lentamente de lo esperado. Además, siempre vimos que nuestro desarrollador hacía todo lo posible para lograr el mejor resultado. Pero, en realidad, la historia resultó ser muy larga, y nuestros especialistas clave dedicaron significativamente más esfuerzo y tiempo del planeado. 
  • En segundo lugar, necesitaron varias etapas de pruebas para optimizar el algoritmo de reserva de máquinas virtuales y canales de comunicación. Inicialmente, hubo fallos tanto en el lado del sistema BMS como en la configuración de las máquinas virtuales y la red. Este ajuste también tomó tiempo. Afortunadamente, se proporcionó al contratista un entorno de prueba en forma de un servicio en la nube, donde inicialmente se probaron todas las configuraciones y novedades.
  • En tercer lugar, el sistema final resultó ser más complicado de editar para el usuario final. Si antes el mapa era una capa (un archivo gráfico) con íconos que se podía cambiar o mover sin dificultad, ahora es una interfaz gráfica complicada con animaciones, que requiere ciertas habilidades para editar.

La renovación radical de nuestro sistema BMS ya se puede considerar el proyecto más importante del año pasado, que afectará seriamente la calidad de la gestión operativa de nuestras instalaciones en el futuro. 

No hemos desechado el viejo servidor de hierro, sino que lo hemos "aligerado": lo limpiamos de miles de "sensores" virtuales comerciales y PDU, dejando solo unos pocos docenas de dispositivos críticos, como DGU, UPS, aires acondicionados, bombas, sensores de fugas y de temperatura. En este modo, ha recuperado su velocidad anterior y puede ser un "reserva de reserva". Por cierto, después de eliminar los PDU del antiguo sistema BMS, nos quedaron alrededor de 1000 licencias que ya no son necesarias, ¿tienes alguna idea de qué hacer con ellas?

Fuente: habr.com

Compra un hosting fiable para sitios web con protección contra DDoS, servidores VPS VDS 🔥 Compra un hosting fiable para sitios web con protección contra DDoS, servidores VPS VDS | ProHoster