În această septembrie, Broadcom (fosta CA) a lansat o nouă versiune 20.2 a soluției sale DX Operations Intelligence (DX OI). Pe piață, acest produs este poziționat ca un sistem de monitorizare de tip umbrelă. Sistemul este capabil să colecteze și să integreze date din sisteme de monitorizare din diferite domenii (rețea, infrastructură, aplicații, baze de date), atât de la CA cât și de la furnizori terți, inclusiv soluții open source (Zabbix, Prometheus și altele).

Funcția principală a DX OI este crearea unui model complet de resurse și servicii (RSM) bazat pe unități de configurare (UC) care completează baza de inventar prin integrarea cu sisteme externe. DX OI a implementat funcții de învățare automată și inteligență artificială (ML și AI) pe datele care intră în platformă, ceea ce permite evaluarea/predictia probabilității de defecțiune a unei anumite UC și a impactului acesteia asupra serviciului de afaceri, care se bazează pe acea UC specifică. În plus, DX OI este un punct unic de colectare a evenimentelor de monitorizare și, prin urmare, este integrat cu sistemul Service Desk, un avantaj incontestabil pentru utilizarea sistemului în centrele de monitorizare unificate cu schimburi de serviciu. În acest articol, vom detalia funcționalitatea sistemului și vom prezenta interfețele utilizatorului și administratorului.
Arhitectura soluției DX OI
Platforma DX are o arhitectură de tip microservicii, fiind instalată și funcționând sub gestionarea Kubernetes sau OpenShift. În imaginea următoare sunt prezentate componentele soluției, care pot fi utilizate ca instrumente de monitorizare independente sau pot fi înlocuite cu sisteme de monitorizare existente cu funcții similare (în imagine sunt exemple de astfel de sisteme) și ulterior conectate la DX OI. În schema de mai jos:
- Monitorizarea aplicațiilor mobile în DX App Experience Analytics;
- Monitorizarea performanței aplicațiilor în DX APM;
- Monitorizarea infrastructurii în DX Infrastructure Manager;
- Monitorizarea dispozitivelor de rețea în DX NetOps Manager.

Componentele DX funcționează sub gestionarea unui cluster Kubernetes și pot fi scalate prin simpla inițiere a unor noi POD. Mai jos este schema de nivel înalt a soluției.

Administrarea, scalarea și actualizarea platformei DX se realizează din consola de administrare. Dintr-o singură consolă, se poate gestiona o arhitectură multi-tenant, care poate acoperi mai multe entități sau mai multe unități de afaceri în cadrul companiei. În acest model, fiecare entitate poate fi configurată individual, ca un chiriaș, cu propriul set de configurații.
Consola de administrare este un instrument web pentru gestionarea operațiunilor și sistemului, care oferă administratorilor o interfață unificată și coerentă pentru îndeplinirea sarcinilor de management al clusterului de monitorizare.

Noi chiriași pentru unități de afaceri sau entități din cadrul companiei sunt desfășurați în câteva minute. Aceasta oferă un avantaj dacă doriți să aveți un sistem de monitorizare unificat, dar în același timp, la nivelul platformei (nu la nivelul drepturilor de acces), să separați obiectele de monitorizare între departamente.

Modele de servicii bazate pe resurse și monitorizarea serviciilor de afaceri
DX OI are mecanisme încorporate pentru crearea serviciilor și dezvoltarea RCM-urilor clasice, definind logica de influență și greutățile între componentele serviciului. Există, de asemenea, mecanisme de export al RCM-urilor dintr-o CMDB externă. În imaginea de mai jos, editorul RCM-ului încorporat (observați greutățile conexiunilor).

DX OI oferă o imagine de ansamblu a indicatorilor cheie de performanță pentru serviciile de afaceri sau serviciile IT, cu detalii, inclusiv disponibilitatea serviciilor și prognoza riscurilor de defectare. Instrumentul poate oferi, de asemenea, o înțelegere a impactului problemelor de performanță sau a modificărilor în structura componentelor IT (aplicații sau infrastructură) asupra serviciului de afaceri. În imaginea de mai jos, un tablou de bord interactiv care afișează starea tuturor serviciilor.

Să luăm în considerare detaliile prin exemplul serviciului Digital Banking. Prin clic pe numele serviciului, trecem la RCM-ul detaliat al acestuia. Vedem că starea serviciului Digital Banking depinde de starea subserviciilor infrastructurale și tranzacționale cu greutăți variate. Lucrul cu greutățile și afișarea acestora este un avantaj interesant al DX OI.

Topologia este un element important al monitorizării operaționale a întreprinderii, permițând operatorilor și inginerilor să analizeze interdependențele dintre componente, să găsească cauza inițială și influențele.
DX OI Topology Viewer este un serviciu care utilizează datele topologice provenind de la sistemele de monitorizare, care colectează informații direct de la obiectele monitorizate. Instrumentul este destinat căutării în mai multe straturi de depozite de topologie și afișării unei hărți a relațiilor, dependentă de context. Pentru investigarea problemelor, puteți accesa subserviciul de probleme Backend Banking și vizualiza topologia și componentele problematice. De asemenea, pentru fiecare componentă, este posibil să analizați mesajele de eroare și metricile de performanță.

În analiza componentelor tranzacționale Payments (tranzacții utilizator), putem urmări valorile KPI de business, care sunt de asemenea luate în considerare la calcularea disponibilității și sănătății serviciului. Un exemplu de KPI de business este prezentat mai jos:


Analiza evenimentelor (Alarm Analytics)
Reducerea zgomotului prin algoritmii de clustering al alertele
Una dintre funcțiile cheie ale DX OI în procesarea evenimentelor este clustering-ul. Mecanismul lucrează cu toate alertele care intră în sistem, pentru a identifica modele bazate pe diferite contexte și a le uni în grupuri. Aceste clustere sunt auto-învățate, nu necesită configurare manuală.

Astfel, clustering-ul permite utilizatorilor să unească și să grupeze un număr imens de evenimente și să analizeze doar acelea care au un context comun. De exemplu, un set de evenimente care reprezintă un incident ce afectează funcționarea aplicațiilor sau a centrului de procesare a datelor. Situațiile sunt create folosind algoritmi de clustering bazate pe învățarea automată, care utilizează pentru analiză corelația temporală, interconectarea topologică și procesarea limbajului natural. În imaginile de mai jos sunt prezentate exemple de vizualizare a grupurilor de mesaje clustering, numite Situations Alarms, și Evidence Timeline, care ilustrează parametrii principali de grupare și procesul de reducere a numărului evenimentelor de zgomot.


Analiza problemelor de bază și corelarea erorilor
Într-un mediu hibrid modern, o tranzacție utilizator poate implica mai multe sisteme utilizate dinamic. Ca rezultat, pot fi generate mai multe alerte din diferite sisteme, dar care sunt legate de aceeași problemă sau incident. DX OI utilizează mecanisme brevetate pentru a suprima alertele redundante și duplicate și pentru a corela alertele asociate, îmbunătățind astfel detectarea problemelor critice și soluționarea rapidă a acestora.
Să luăm un exemplu în care sistemul primește numeroase mesaje de urgență pentru diferite obiecte (KE) care stau la baza unui singur serviciu. În cazul în care impactează disponibilitatea și funcționalitatea serviciului, sistemul va genera o alarmă de serviciu (Service Alarm), va identifica și va desemna cauza probabilă a problemei (KE problematic și mesajul de alarmă pentru KE) care a contribuit la degradarea performanței sau la defectarea serviciului. În imaginea de mai jos este prezentată o vizualizare a situației de urgență pentru serviciul Webex.

DX OI permite gestionarea evenimentelor prin acțiuni intuitive în interfața web a sistemului. Utilizatorii pot asigna manual evenimente unui angajat responsabil pentru depanare, pot reseta/confirma alertele, pot crea cereri sau pot trimite notificări prin e-mail, pot lansa scenarii automatizate pentru a remedia situația de urgență (Remediation Workflow, despre care vom vorbi mai târziu). Astfel, DX OI le permite operatorilor de tură să se concentreze pe mesajul de alertă principal, precum și să ajute la simplificarea procesului de filtrare a mesajelor către matricele cluster.
Algoritmi de procesare a metricilor și analiză a datelor de performanță
Învățarea automată permite monitorizarea, agregarea și vizualizarea indicatorilor cheie de performanță pe o anumită perioadă de timp, oferind utilizatorului următoarele avantaje:
- Detectarea blocajelor și anomaliilor de performanță;
- Compararea mai multor indicatori pentru aceleași dispozitive, interfețe sau rețele;
- Compararea acelorași indicatori pe mai multe obiecte;
- Compararea diferitelor indicatori pe unul sau mai multe obiecte;
- Compararea metricilor multidimensionale pe mai multe obiecte.
Pentru analiza metricilor care intră în sistem, DX OI utilizează funcții de analiză automată prin aplicarea algoritmilor matematici, ceea ce contribuie la reducerea timpului de configurare a pragurilor statice și generarea de alerte în caz de anomalii.

Rezultatul aplicării algoritmilor matematici este construirea așa-numitelor distribuții probabilistice ale valorii metricii (Rare, Probable, Center, Mean, Actual). În ilustrațiile de mai sus și de mai jos sunt prezentate distribuțiile probabilistice.

Pe cele două grafice de mai sus sunt afișate următoarele date:
- Datele reale (Actual). Datele reale sunt reprezentate pe grafic sub formă de linie continuă neagră (fără semnale de alarmă) sau linie continuă colorată (stare de alarmă). Linia este calculată pe baza datelor reale pentru metrică. Comparând datele reale cu valoarea mediană, puteți vedea rapid variațiile metricii. Când apare un eveniment, linia neagră se schimbă în linie continuă colorată, care corespunde criticității evenimentului și afișează simboluri cu criticitatea corespunzătoare deasupra graficului. De exemplu, culoarea roșie pentru anomalii critice, portocalie pentru anomalii semnificative și galbenă pentru anomalii minore.
- Valoarea medie a indicatorului (Mean value). Valoarea medie sau media pentru indicator este reprezentată pe diagramă printr-o linie gri. Valoarea medie este afișată atunci când lipsesc datele istorice.
- Valoarea mediană a indicatorului (Center value). Linia mediană reprezintă mijlocul intervalului și este afișată printr-o linie punctată verde. Zonele cele mai apropiate de această linie sunt cele mai apropiate de valorile tipice ale indicatorului.
- Datele generale (Common Value). Datele zonei comune urmăresc cea mai apropiată linie centrală sau normă pentru indicatorul dumneavoastră și sunt reprezentate sub formă de bandă verde închis. Calculul analitic plasează zona comună cu un percentil mai sus sau mai jos de normă.
- Datele probabilistice. Datele zonei probabilistice sunt prezentate pe grafic sub formă de bandă verde. Sistemul plasează zona probabilistică cu două percentile mai sus sau mai jos de normă.
- Date rare. Informațiile despre zonele rare sunt prezentate în grafic sub formă de bandă verde deschis. Sistemul plasează zona cu valori rare ale metricii cu trei percentili mai sus sau mai jos de normal și semnalizează comportamentul indicatorului dincolo de intervalul normal, generând astfel așa-numitul Anomaly Alert.
O anomalie este o măsurare sau un eveniment care nu corespunde valorilor normale ale metricii. Detectarea anomaliilor pentru a identifica probleme și a înțelege tendințele în infrastructură și aplicații este o caracteristică esențială a DX OI. Detectarea anomaliilor permite atât recunoașterea comportamentului neobișnuit (de exemplu, un server care răspunde mai lent decât de obicei sau o activitate de rețea neobișnuită cauzată de o breșă de securitate), cât și reacționarea corespunzătoare (generarea unui incident, pornirea unui script de remediere automată).
Funcția de detectare a anomaliilor DX OI oferă următoarele avantaje:
- Nu este necesară stabilirea unor valori de prag. DX OI va corela datele și va identifica anomaliile de la sine.
- DX OI include mai mult de zece algoritmi de inteligență artificială și învățare automată, printre care EWMA (Exponential Weighted—Moving Average) și KDE (Kernel Density Estimation). Acești algoritmi permit analiza rapidă a cauzelor fundamentale și prognoza valorilor viitoare ale metricilor.
Analiza predictivă și notificarea cu privire la posibilele defecte
Predictive Insights este o funcție care utilizează capacitățile învățării automate pentru a identifica modele și tendințe. Pe baza acestor tendințe, sistemul prognozează evenimente care ar putea avea loc în viitor. Aceste notificări indică necesitatea de a lua măsuri înainte ca valorile metricilor să depășească limitele normalității, ceea ce ar putea afecta serviciile de afaceri critice. Predictive Insights este ilustrat în figura de mai jos.

Iată o vizualizare a avertismentelor predictive pentru o metrică specifică.

Prognoza sarcinii de calcul cu funcția de definire a scenariilor de sarcină
Funcția de planificare a capacităților Capacity Analytics ajută la gestionarea resurselor IT, asigurând dimensiunea corectă a resurselor pentru a satisface nevoile curente și viitoare ale afacerii. Vei putea optimiza performanța și eficiența resurselor existente, planifica și justifica orice investiții financiare.
Funcția Capacity Analytics în DX OI oferă următoarele avantaje:
- Previzionarea capacităților în sezoni de vârf;
- Identificarea momentului în care sunt necesare resurse suplimentare pentru a asigura funcționarea de calitate a serviciului;
- Achiziționarea de resurse suplimentare doar când este necesar;
- Management eficient al infrastructurii și rețelelor;
- Eliminarea costurilor excesive cu energia electrică prin identificarea resurselor subutilizate;
- Realizarea evaluării încărcării resurselor în cazul unei creșteri planificate a cererii pentru serviciu sau resursă.
Pe pagina Capacity Analytics DX OI (ilustrarea de mai jos) sunt următoarele widget-uri:
- Starea capacității resursei (Resource Capacity Status);
- Grupe/servicii monitorizate (Monitored Groups/Services);
- Cei mai mari consumatori de resurse (Top Capacity Consumers).

Pagina principală Capacity Analytics arată componentele resurselor care sunt suprasolicitate și care își ating capacitatea maximă. Această pagină ajută administratorii platformei să identifice resursele folosite excesiv și îi ajută să redimensioneze și să optimizeze resursele. Starea resurselor poate fi analizată pe baza codurilor de culori și a valorilor corespunzătoare. Resursele sunt clasificate în funcție de gradul de suprasolicitare pe pagina de stare a capacității resurselor. Poate fi făcut clic pe fiecare dintre culori pentru a vizualiza lista componentelor incluse în categoria selectată. Apoi va fi afișată o hartă termică cu toate obiectele și prognozările pe 12 luni, permițând identificarea resurselor care urmează să fie epuizate.

Pentru fiecare dintre metricile din Capacity Analytics pot fi specificate filtre, pe care DX Operational Intelligence le folosește pentru a crea prognoze (ilustrarea de mai jos).

Sunt disponibile următoarele filtre:
- Metric. Metrica care va fi folosită pentru prognoză.
- Base on. Selectarea volumului de date istorice care vor fi utilizate pentru a construi prognoze pentru viitor. Acest câmp este folosit pentru comparații și analiza tendințelor din ultima lună, tendințelor din ultimele 3 luni, tendințelor din ultimul an etc.
- Growth. Viteza de creștere a încărcăturii de lucru așteptate pe care doriți să o utilizați pentru modelarea prognozei de capacitate. Aceste date pot fi folosite pentru a prognoza creșteri care depășesc estimările. De exemplu, se așteaptă ca utilizarea resurselor să crească cu încă 40 la sută datorită deschiderii unui nou birou.
Analiza jurnalelor
Funcția de analiză a jurnalelor DX OI oferă:
- colectarea și agregarea jurnalelor din diferite surse (inclusiv cele obținute prin metode agent și fără agent);
- parsingul și normalizarea datelor;
- analiza conformității cu condițiile stabilite și generarea evenimentelor;
- corelarea evenimentelor pe baza jurnalelor, inclusiv cu evenimentele obținute prin monitorizarea infrastructurii IT;
- vizualizarea datelor pe baza analizei în DX Dashboards;
- concluzii despre disponibilitatea serviciilor bazate pe analiza datelor din jurnale.

Colectarea jurnalelor prin metoda fără agent se efectuează de sistem pentru Windows Event logs și Syslog. Prin metoda agent se colectează jurnale text.
Funcția de remediere automatizată a incidentelor (Remediation)
Acțiunile automatizate de remediere a incidentelor (Remediation Workflow) permit soluționarea problemelor care au generat evenimente în DX OI. De exemplu, o problemă la încărcarea CPU generează un mesaj de urgență, procesul de remediere (Remediation Workflow) rezolvă problema prin repornirea serverului pe care a apărut problema. Integrarea între DX OI și sistemul de automatizare permite lansarea proceselor de remediere din consola de evenimente în DX Operational Intelligence și monitorizarea acestora în consola sistemului de automatizare.
După integrarea cu sistemul de automatizare, se pot lansa acțiuni automate de remediere a oricărei incidente din consola DX OI din contextul mesajului de urgență. Puteți vizualiza acțiunile recomandate împreună cu informațiile despre procentele de plasabilitate (probabilitatea de a remedia situația prin executarea acțiunii).


Inițial, când nu există statistici despre rezultatele implementării Remediation Workflow, mecanismul de recomandări oferă opțiuni potențiale pe baza căutării prin cuvinte cheie, apoi se folosesc rezultatele învățării automate, iar mecanismul începe să recomande metoda de remediere pe baza euristicii. Pe măsură ce începeți să evaluați rezultatele sugestiilor primite, acuratețea recomandărilor se va îmbunătăți.

Exemplu de feedback de la utilizator: utilizatorul alege acțiunea propusă care îi place sau nu, iar sistemul ia în considerare această alegere în recomandările viitoare. Like/dislike:

Acțiunile corective recomandate pentru o alerta specifică se bazează pe o combinație de feedback care determină dacă acțiunea este acceptabilă. DX OI vine cu integrare gata făcută cu sistemul de automatizare Automic Automation.
Integrarea DX OI cu sisteme terțe
Nu ne vom detalia integrarea datelor din produsele de monitorizare native Broadcom (DX NetOps, DX Infrastructure Management, DX Application Performance Management). În schimb, vom analiza cum se integrează datele din sistemele terțe și vom lua ca exemplu integrarea cu unul dintre cele mai populare sisteme — Zabbix.
Pentru integrarea cu sistemele terțe se folosește componenta DX Gateway. DX Gateway este format din 3 componente — On-Prem Gateway, RESTmon și Log Collector (Logstash). Puteți instala toate cele 3 componente sau doar cea necesară, modificând fișierul de configurare principal în timpul instalării DX Gateway. În imaginea de mai jos este prezentată arhitectura DX Gateway.

Să analizăm rolul componentelor DX Gateway separat.
On-Prem Gateway. Acesta este interfața care colectează alertele de la platforma DX și trimite evenimentele de alarmă către sistemele terțe. On-Prem Gateway acționează ca un poller care colectează periodic date despre evenimente din DX OI, folosind cereri API prin protocolul HTTPS, apoi trimite avertizări pe un server terț, care este integrat cu platforma DX, folosind webhook-uri.

DX Log Collector primește syslog de la dispozitivele de rețea sau servere și le încarcă în OI. DX Log Collector permite separarea software-ului care generează mesaje, sistemului care le stochează și software-ului care le raportează și analizează. Fiecare mesaj este etichetat cu un cod de obiect care indică tipul software-ului care generează mesajul și i se atribuie un nivel de criticitate. În DX Dashboards, toate aceste informații pot fi apoi vizualizate.
DX RESTmon se integrează cu produse/servicii terțe prin REST API și transmite date în OI. În imaginea de mai jos este prezentată schema de funcționare a DX RESTmon pe exemplul integrării cu sistemele de monitorizare Solarwinds și SCOM.

Funcții cheie ale DX RESTmon:
- Conectarea la orice sursă de date externă pentru a primi date:
- PULL: conectare și extragere de date din API-uri REST publice;
- PUSH: flux de date în RESTmon prin REST.
- Suport pentru formatele JSON și XML;
- Primirea metricilor, alertele, grupurilor, topologiei, inventarului și jurnalelor;
- Conectori gata făcuți pentru diverse instrumente/tehnologii; de asemenea, este posibil să se dezvolte un conector pentru orice sursă cu API deschis (lista conectorilor standard este prezentată mai jos);
- Suport pentru autentificarea de bază (implicit) la accesarea interfeței Swagger și API;
- Suport pentru HTTPS (implicit) pentru toate mesajele de intrare și ieșire;
- Suport pentru proxy-uri de intrare și ieșire;
- Capabilități puternice de analiză sintactică a textului pentru jurnalele obținute prin REST;
- Analiza sintactică personalizabilă prin RESTmon, asigurând o analiză și vizualizare eficientă a jurnalelor;
- Suport pentru extragerea informațiilor despre grupurile de dispozitive din aplicațiile de monitorizare și încărcarea acestora în OI pentru analiză și vizualizare;
- Suport pentru posibilitatea de a face potriviri cu expresii regulate. Acest lucru poate fi utilizat pentru analiza sintactică și potrivirea mesajelor din jurnalele primite prin REST, precum și pentru generarea sau închiderea evenimentelor pe baza anumitor condiții ale expresiilor regulate.

Acum să examinăm procesul de configurare a integrării DX OI cu Zabbix prin DX RESTmon. Integrările standard extrag următoarele date din Zabbix:
- datele de inventar;
- topologia;
- problemele;
- metricile.
Deoarece conectorul pentru Zabbix este disponibil din cutie, tot ce trebuie să faceți pentru a configura integrarea este să actualizați profilul, specificând adresa IP a serverului API Zabbix și contul, apoi să încărcați profilul prin interfața web Swagger. Exemplul este prezentat în următoarele două imagini.


După configurarea integrării, pentru datele provenite din Zabbix vor fi disponibile funcții analitice DX OI, descrise mai sus, și anume: Alarm Analytics, Performance Analytics, Predictive Insights, Service Analytics și Remediation. În imaginea de mai jos este prezentat un exemplu de analiză a metricilor de performanță pentru obiectele integrate din Zabbix.

Concluzie
DX OI — un instrument modern de analiză, care va asigura o eficiență operațională semnificativă pentru departamentele IT, permițându-le să ia decizii mai rapide și mai corecte pentru îmbunătățirea calității serviciilor IT și a serviciilor de afaceri prin analiza contextuală interdomain. Pentru proprietarii de aplicații și departamentele de afaceri, DX OI va calcula disponibilitatea și calitatea serviciilor nu doar în contextul indicatorilor IT tehnologici, ci și al KPI-urilor de afaceri, extrase din statisticile tranzacționale ale utilizatorilor finali.
Dacă doriți să aflați mai multe despre această soluție, lăsați o cerere pentru o demonstrație sau un proiect pilot. site-ului nostru.
Sursa: habr.com
