En septiembre, Broadcom (anteriormente CA) lanzó la nueva versión 20.2 de su solución DX Operations Intelligence (DX OI). En el mercado, este producto se posiciona como un sistema de monitoreo integral. El sistema puede recibir y combinar datos de sistemas de monitoreo de diversos dominios (red, infraestructura, aplicaciones, bases de datos) tanto de CA como de otros proveedores, incluidos soluciones de código abierto (Zabbix, Prometheus, entre otros).

La función principal de DX OI es crear un modelo de recursos y servicios (RSM) completo basado en unidades de configuración (CU), que alimentan la base de inventario mediante la integración con sistemas externos. DX OI implementa funciones de Machine Learning y Artificial Intelligence (ML y AI) sobre los datos que ingresan en la plataforma, lo que permite evaluar/forecast la probabilidad de falla de una CU específica y el grado de impacto de la falla en el servicio empresarial, cuyo fundamento es una CU específica. Además, DX OI es un único punto de recopilación de eventos de monitoreo y, en consecuencia, de integración con el sistema Service Desk, lo que es una ventaja indiscutible para el uso del sistema en centros de monitoreo unificados por turnos de organización. En este artículo, hablaremos más sobre la funcionalidad del sistema y mostraremos las interfaces de usuario y administrador.
Arquitectura de la solución DX OI
La plataforma DX tiene una arquitectura de microservicios, se instala y funciona bajo la administración de Kubernetes o OpenShift. En la siguiente imagen se presentan los componentes de la solución, que pueden usarse como herramientas de monitoreo independientes o pueden ser reemplazados por sistemas de monitoreo existentes con funciones similares (en la imagen hay ejemplos de tales sistemas) y luego conectarse al paraguas DX OI. En el esquema a continuación:
- Monitoreo de aplicaciones móviles en DX App Experience Analytics;
- Monitoreo del rendimiento de aplicaciones en DX APM;
- Monitoreo de infraestructura en DX Infrastructure Manager;
- Monitoreo de dispositivos de red en DX NetOps Manager.

Los componentes DX funcionan bajo la gestión de un clúster de Kubernetes y se escalan simplemente iniciando nuevos POD. A continuación, un esquema a alto nivel de la solución.

La administración, escalabilidad y actualización de la plataforma DX se realiza desde la consola administrativa. Desde una única consola, se puede gestionar una arquitectura multitenant que puede abarcar varias empresas o unidades de negocio dentro de la misma compañía. En este modelo, cada empresa puede configurarse de manera individual como un inquilino, con su propio conjunto de configuraciones.
La consola de administración es una herramienta web para gestionar operaciones y el sistema, que proporciona a los administradores una interfaz unificada y coherente para llevar a cabo tareas de gestión del clúster de monitoreo.

Los nuevos inquilinos para unidades de negocio o empresas dentro de una compañía se implementan en cuestión de minutos. Esto es ventajoso si deseas tener un sistema de monitoreo único, mientras que a nivel de plataforma (y no mediante derechos de acceso) se delimitan los objetos de monitoreo entre las divisiones.

Modelos de servicios de recursos y monitoreo de servicios empresariales
DX OI tiene mecanismos integrados para crear servicios y desarrollar modelos de servicios de recursos (RSM) clásicos, definiendo la lógica de impacto y pesos entre los componentes del servicio. También hay mecanismos para exportar RSM de una CMDB externa. En la imagen a continuación se muestra el editor integrado de RSM (presta atención a los pesos de las conexiones).

DX OI proporciona una visión integral de los indicadores clave de desempeño de los servicios empresariales o de TI, con detalles que incluyen la disponibilidad de los servicios y la previsión de riesgos de fallos. La herramienta también puede ofrecer información sobre el impacto de un problema de rendimiento o cambios en la estructura de los componentes de TI (aplicaciones o infraestructura) en el servicio empresarial. En la imagen a continuación se muestra un panel interactivo que muestra el estado de todos los servicios.

Examinemos los detalles tomando como ejemplo el servicio de Banca Digital. Al hacer clic en el nombre del servicio, accedemos al RSM detallado del servicio. Observamos que el estado del servicio de Banca Digital depende del estado de los subservicios de infraestructura y transacción, con diferentes pesos. Trabajar con pesos y su visualización es una ventaja interesante de DX OI.

La topología es un elemento crucial para la supervisión operativa de la empresa, permitiendo a los operadores e ingenieros analizar las relaciones entre los componentes, identificar la causa raíz y su impacto.
El Visualizador de Topología DX OI es un servicio que utiliza datos topológicos provenientes de sistemas de monitoreo de dominios, los cuales recogen información directamente de los objetos de monitoreo. Esta herramienta está destinada a buscar en varias capas de almacenamiento de topología y a mostrar un mapa de relaciones que depende del contexto. Para investigar problemas, se puede acceder al subtipo problemático Backend Banking y ver la topología y los componentes problemáticos. Además, se pueden analizar los mensajes de fallo y las métricas de rendimiento de cada componente.

Al analizar los componentes transaccionales de Pagos (transacciones de usuarios), podemos rastrear los valores de KPI de negocio que también se tienen en cuenta al calcular el estado de disponibilidad y la salud del servicio. A continuación se presenta un ejemplo de KPI de negocio:


Análisis de Eventos (Alarm Analytics)
Supresión de ruido algorítmica mediante la clusterización de fallos
Una de las funciones clave de DX OI al procesar eventos es la clusterización. El mecanismo trabaja sobre todas las alertas que ingresan al sistema para identificar patrones basados en diferentes contextos y agruparlos. Estos clústeres son autoadaptativos y no necesitan ser configurados manualmente.

De este modo, la clusterización permite a los usuarios agrupar y combinar una gran cantidad de eventos y analizar solo aquellos que tienen un contexto común. Por ejemplo, un conjunto de eventos que representan un incidente que afecta el funcionamiento de aplicaciones o de un centro de datos. Las situaciones se crean utilizando algoritmos de clusterización basados en aprendizaje automático que emplean correlación temporal, interrelación topológica y procesamiento de lenguaje natural (native language) para el análisis. En las imágenes a continuación se muestran ejemplos de visualización de grupos de mensajes clúster, conocidos como Situations Alarms, y Evidence Timeline, que representan los parámetros clave de agrupamiento y el proceso de reducción de eventos de ruido.


Análisis de problemas raíz y correlación de fallos.
En un entorno híbrido moderno, una transacción del usuario puede involucrar varios sistemas que se utilizan de manera dinámica. Como resultado, pueden generarse múltiples alertas de diferentes sistemas, pero relacionadas con el mismo problema o incidente. DX OI utiliza mecanismos patentados para suprimir alertas redundantes y duplicadas y correlacionar alertas relacionadas para mejorar la detección de problemas críticos y facilitar una resolución más rápida.
Tomemos el ejemplo en el que el sistema recibe numerosos mensajes de emergencia sobre diferentes objetos (KE) subyacentes a un solo servicio. En caso de impacto en la disponibilidad y funcionalidad del servicio, el sistema generará una alarma de servicio, indicará y señalará la probable causa raíz (el KE problemático y el mensaje de emergencia correspondiente), que contribuyó a la disminución del rendimiento o a la falla del servicio. En la imagen a continuación se presenta una visualización de la situación de emergencia para el servicio Webex.

DX OI permite gestionar eventos a través de acciones intuitivas en la interfaz web del sistema. Los usuarios pueden asignar manualmente eventos a un empleado responsable para la resolución de problemas, restablecer/confirmar alertas, crear tickets o enviar notificaciones por correo electrónico, y ejecutar scripts automatizados para la remediación de situaciones de emergencia (Remediation Workflow, de esto hablaré más adelante). De esta manera, DX OI permite a los operadores de turnos concentrarse en el mensaje de emergencia raíz, así como ayudar a simplificar el proceso de clasificación de mensajes en clústeres.
Algoritmos de máquina para el procesamiento de métricas y análisis de datos de rendimiento.
El aprendizaje automático permite rastrear, agregar y visualizar indicadores clave de rendimiento durante cualquier período específico, lo que brinda al usuario las siguientes ventajas:
- Detección de cuellos de botella y anomalías en el rendimiento;
- Comparación de múltiples indicadores para los mismos dispositivos, interfaces o redes;
- Comparación de indicadores idénticos en múltiples objetos;
- Comparación de diferentes indicadores en uno o varios objetos;
- Comparación de métricas multidimensionales en varios objetos.
Para el análisis de las métricas que ingresan al sistema, DX OI utiliza funciones de análisis de máquinas aplicando algoritmos matemáticos, lo que ayuda a reducir el tiempo en la configuración de umbrales estáticos y en la generación de alertas ante la aparición de anomalías.

El resultado de la aplicación de algoritmos matemáticos es la construcción de lo que se conoce como distribuciones de probabilidad del valor de la métrica (Rara, Probable, Centro, Media, Actual). En las ilustraciones anteriores y siguientes se presentan las distribuciones de probabilidad.

En los dos gráficos anteriores se muestran los siguientes datos:
- Datos actuales (Actual). Los datos actuales se muestran en el gráfico como una línea negra continua (sin señales de alarma) o una línea continua de color (estado de alarma). La línea se calcula sobre la base de los datos actuales de la métrica. Comparando los datos actuales con el valor mediano, puedes ver rápidamente las variaciones de la métrica. Cuando ocurre un evento, la línea negra cambia a una línea continua de color que corresponde a la criticidad del evento y muestra iconos con la correspondiente criticidad sobre el gráfico. Por ejemplo, rojo para anomalías críticas, naranja para anomalías significativas y amarillo para anomalías menores.
- Valor medio (Mean value). El valor medio o promedio del indicador se muestra en el gráfico como una línea gris. El promedio se representa cuando faltan datos históricos.
- Valor mediano (Center value). La línea mediana es el punto medio del rango y se muestra como una línea discontinua verde. Las zonas más cercanas a esta línea son las más cercanas a los valores típicos del indicador.
- Datos comunes (Common Value). Los datos de la zona común rastrean la línea central o norma más cercana para tu indicador y se muestran como una banda verde oscura. Los cálculos analíticos colocan la zona común en un percentil por encima o por debajo de la norma.
- Datos probabilísticos. Los datos de la zona de probabilidad se muestran en el gráfico como una banda verde. El sistema coloca la zona de probabilidad en dos percentiles por encima o por debajo de la norma.
- Datos raros. Los datos sobre zonas anormales se muestran en el gráfico como una franja verde claro. El sistema coloca una zona con valores atípicos de la métrica en tres percentiles por encima o por debajo de la norma y señala el comportamiento del indicador fuera del rango normal; en este caso, el sistema genera una alerta de anomalía.
Una anomalía es una medida o evento que no coincide con los indicadores normales de la métrica. La detección de anomalías para identificar problemas y entender las tendencias en la infraestructura y las aplicaciones es una característica clave de DX OI. La detección de anomalías permite tanto reconocer comportamientos inusuales (como un servidor que responde más lentamente de lo habitual o una actividad de red inusual provocada por una violación) como responder adecuadamente (creando un incidente, iniciando un script de remediación automático).
La función de detección de anomalías DX OI ofrece las siguientes ventajas:
- No es necesario establecer valores umbral. DX OI comparará los datos por sí mismo y detectará anomalías.
- DX OI incluye más de diez algoritmos de inteligencia artificial y aprendizaje automático, entre ellos EWMA (Promedio Móvil Ponderado Exponencialmente) y KDE (Estimación de Densidad de Núcleo). Estos algoritmos permiten realizar un análisis rápido de la causa raíz y predecir futuros valores de métricas.
Análisis predictivo y alerta sobre posibles fallos.
Predictive Insights es una función que utiliza capacidades de aprendizaje automático para identificar patrones y tendencias. Basándose en estas tendencias, el sistema prevé eventos que pueden ocurrir en el futuro. Estos informes indican la necesidad de tomar medidas antes de que los valores de las métricas excedan los valores normales, lo que podría afectar a los servicios empresariales críticos. Predictive Insights se representa en la imagen a continuación.

Aquí hay una visualización de las advertencias predictivas para una métrica específica.

Prevención de la carga de capacidad computacional con la función de asignación de escenarios de carga.
La función de planificación de capacidades Capacity Analytics ayuda a gestionar los recursos de TI, asegurando el tamaño adecuado de los recursos para satisfacer las necesidades actuales y futuras del negocio. Podrá optimizar el rendimiento y la eficiencia de los recursos existentes, planificar y justificar cualquier inversión financiera.
La función Capacity Analytics en DX OI ofrece las siguientes ventajas:
- Predicción de capacidades en temporadas pico;
- Determinación del momento en que se necesitarán recursos adicionales para garantizar el correcto funcionamiento del servicio;
- Compra de recursos adicionales solo cuando sea necesario;
- Gestión eficiente de la infraestructura y las redes;
- Eliminación de costos innecesarios de energía eléctrica al identificar recursos infrautilizados;
- Evaluación de la carga en los recursos en caso de un aumento planificado de las necesidades del servicio o recurso.
En la página Capacity Analytics DX OI (ver figura abajo) hay los siguientes widgets:
- Estado de capacidad del recurso (Resource Capacity Status);
- Grupos/servicios controlados (Monitored Groups/Services);
- Principales consumidores de recursos (Top Capacity Consumers).

La página principal de Capacity Analytics muestra los componentes de recursos que están sobrecargados y cuyos límites de capacidad están próximos a agotarse. Esta página ayuda a los administradores de la plataforma a identificar recursos que se utilizan en exceso y a redimensionar y optimizar dichos recursos. El estado de los recursos puede analizarse en función de códigos de colores y sus correspondientes valores. Los recursos se clasifican según su grado de sobrecarga en la página del estado de capacidad del recurso. Se puede hacer clic en cada uno de los colores para ver la lista de componentes que pertenecen a la categoría seleccionada. A continuación, se muestra un mapa de calor con todos los objetos y pronósticos para 12 meses, permitiendo identificar los recursos que pronto estarán agotados.

Para cada una de las métricas en Capacity Analytics se pueden especificar filtros que DX Operational Intelligence utiliza para crear pronósticos (ver figura abajo).

Los siguientes filtros están disponibles:
- Métrica. Métrica que se utilizará para la predicción.
- Base on. Selección del volumen de datos históricos que se utilizarán para construir pronósticos futuros. Este campo se utiliza para comparar y analizar tendencias del último mes, tendencias de los últimos 3 meses, tendencias del último año, etc.
- Crecimiento. La velocidad esperada de crecimiento de la carga de trabajo que desea utilizar para modelar la proyección de potencia. Estos datos se pueden usar para prever el crecimiento más allá de las proyecciones. Por ejemplo, se espera que el uso del recurso aumente en un 40 por ciento debido a la apertura de una nueva oficina.
Análisis de logs
La función de análisis de logs DX OI proporciona:
- recolección y agregación de logs de diferentes fuentes (incluyendo los obtenidos por métodos con y sin agente);
- parsing y normalización de datos;
- análisis de conformidad con condiciones establecidas y generación de eventos;
- correlación de eventos basado en logs, incluidos los eventos obtenidos a partir del monitoreo de la infraestructura de TI;
- visualización de datos basada en el análisis en DX Dashboards;
- conclusiones sobre la disponibilidad de servicios basadas en el análisis de datos de logs.

La recolección de logs por el método sin agente se realiza para los logs de eventos de Windows y Syslog. Los logs de texto se recopilan de forma agente.
Función de resolución automatizada de incidentes (Remediation)
Las acciones automatizadas para la corrección de incidentes (Remediation Workflow) permiten resolver problemas que han generado eventos en DX OI. Por ejemplo, un problema de sobrecarga de CPU genera un mensaje de alerta, el proceso de corrección (Remediation Workflow) aborda el problema reiniciando el servidor donde ocurrió. La integración entre DX OI y el sistema de automatización permite ejecutar procesos de corrección desde la consola de eventos de DX Operational Intelligence y hacer un seguimiento desde la consola del sistema de automatización.
Después de la integración con el sistema de automatización, se pueden ejecutar acciones automatizadas para corregir cualquier incidente en la consola de DX OI desde el contexto del mensaje de alerta. Puede revisar las acciones recomendadas junto con información sobre el porcentaje de precisión (probabilidad de resolver la situación mediante la acción).


Originalmente, cuando no hay estadísticas de los resultados de ejecución del Remediation Workflow, el mecanismo de recomendaciones sugiere opciones potenciales basadas en la búsqueda por palabras clave, luego se utilizan los resultados de aprendizaje automático y el mecanismo comienza a recomendar el método de corrección basado en heurísticas. A medida que comience a evaluar los resultados de las sugerencias recibidas, la precisión de las recomendaciones mejorará.

Ejemplo de retroalimentación del usuario: el usuario elige una acción propuesta que le guste o no, y el sistema toma en cuenta esta elección para futuras recomendaciones. Me gusta/no me gusta:

Las acciones correctivas recomendadas para una alarma específica se basan en una combinación de retroalimentación que determina si la acción es aceptable. DX OI viene con integración lista para usar con el sistema de automatización Automic Automation.
Integración de DX OI con sistemas de terceros
No nos detendremos a detallar la integración de datos de los productos nativos de monitoreo de Broadcom (DX NetOps, DX Infrastructure Management, DX Application Performance Management). En su lugar, abordaremos cómo se integran los datos de sistemas de terceros y examinaremos un ejemplo de integración con uno de los sistemas más populares: Zabbix.
Para la integración con sistemas de terceros se utiliza el componente DX Gateway. DX Gateway consta de 3 componentes: On-Prem Gateway, RESTmon y Log Collector (Logstash). Puede instalar los 3 componentes o solo el que necesita, modificando el archivo de configuración general al instalar DX Gateway. En la imagen de abajo se muestra la arquitectura de DX Gateway.

Analicemos la función de los componentes DX Gateway por separado.
On-Prem Gateway. Esta es la interfaz que recoge señales de emergencia de la plataforma DX y envía eventos de fallos a sistemas de terceros. On-Prem Gateway actúa como un poller que recopila periódicamente datos sobre eventos de DX OI, utilizando solicitudes API a través del protocolo HTTPS, y luego envía alertas a un servidor de terceros que está integrado con la plataforma DX, utilizando webhooks.

DX Log Collector recibe syslog de dispositivos de red o servidores los carga en OI. DX Log Collector permite separar el software que genera los mensajes, el sistema que los almacena y el software que los comunica y analiza. Cada mensaje es etiquetado con un código de objeto que indica el tipo de software que genera el mensaje, y se le asigna un nivel de criticidad. En los tableros de DX, todo esto se puede consultar luego.
DX RESTmon se integra con productos/servicios de terceros a través de REST API y transmite datos a OI. En la imagen de abajo se presenta un esquema de funcionamiento de DX RESTmon a modo de ejemplo de integración con los sistemas de monitoreo Solarwinds y SCOM.

Funciones clave de DX RESTmon:
- Conexión a cualquier fuente de datos externa para la recepción de datos:
- PULL: conexión y extracción de datos de APIs REST públicas;
- PUSH: transmisión de datos a RESTmon a través de REST.
- Soporte para formatos JSON y XML;
- Recepción de métricas, alertas, grupos, topologías, inventario y registros;
- Conectores predefinidos para diversas herramientas/tecnologías, también es posible desarrollar un conector para cualquier fuente con API abierta (lista de conectores listos en la imagen abajo);
- Soporte para autenticación básica (por defecto) al acceder a la interfaz Swagger y la API;
- Soporte para HTTPS (por defecto) para todos los mensajes entrantes y salientes;
- Soporte para proxies entrantes y salientes;
- Potentes capacidades de análisis de texto para registros obtenidos a través de REST;
- Análisis sintáctico personalizable utilizando RESTmon, proporcionando un análisis efectivo y visualización de registros;
- Soporte para la extracción de información sobre grupos de dispositivos de aplicaciones de monitoreo y su carga en OI para análisis y visualización;
- Soporte para coincidencias con expresiones regulares. Esto puede utilizarse para el análisis sintáctico y coincidencia de mensajes de registros obtenidos a través de REST, así como para la generación o cierre de eventos basados en ciertas condiciones de expresiones regulares.

Ahora consideremos el proceso de configuración de la integración DX OI con Zabbix a través de DX RESTmon. La integración lista extrae los siguientes datos de Zabbix:
- datos de inventario;
- topología;
- problemas;
- métricas.
Dado que el conector para Zabbix está disponible de manera estándar, todo lo que se necesita hacer para configurar la integración es actualizar el perfil especificando la dirección IP del servidor API de Zabbix y la cuenta, y luego cargar el perfil a través de la interfaz web de Swagger. Ejemplo en las dos imágenes siguientes.


Después de configurar la integración, las funciones analíticas de DX OI descritas anteriormente estarán disponibles para los datos que provienen de Zabbix, a saber: Alarm Analytics, Performance Analytics, Predictive Insights, Service Analytics y Remediation. En la imagen abajo se muestra un ejemplo de análisis de métricas de rendimiento por objetos integrados desde Zabbix.

Conclusión
DX OI es una herramienta moderna de análisis que garantizará una significativa eficiencia operativa en los departamentos de TI, permitiendo tomar decisiones más rápidas y precisas para mejorar la calidad de los servicios de TI y los servicios empresariales a través del análisis contextual interdominios. Para los propietarios de aplicaciones y las unidades de negocio, DX OI calculará el indicador de disponibilidad y la calidad de los servicios no solo en el contexto de métricas tecnológicas de TI, sino también de KPI empresariales extraídos de la estadística transaccional de los usuarios finales.
Si desea saber más sobre esta solución, deje su solicitud para una demostración o un proyecto piloto. en nuestro sitio web.
Fuente: habr.com
