Monitorizare în Data Center: cum am înlocuit vechiul BMS cu unul nou. Partea 3

Continuăm povestea noastră despre cum am schimbat sistemul BMS în centrele noastre de date (partea 1, partea 2). Nu am pur și simplu schimbat soluția unui furnizor cu alta, ci am dezvoltat un sistem de la zero, adaptat la cerințele noastre. În concluzia poveștii noastre, împărtășim rezultatele muncii depuse și soluții interesante care ar putea fi utile pentru voi.

Nouă interfață

Aici, cum se spune, mai bine să vezi o dată.

Monitorizare în Data Center: cum am înlocuit vechiul BMS cu unul nou. Partea 3Rack-uri.

Să analizăm diferențele.

  • În primul rând, este frumos convenabil. Observați cât de ușor a devenit să urmărim sarcinile pe modulele („Banks” sau pur și simplu „Bancuri”) PDU și suma sarcinilor paralele ale modulilor pereche. Pe modelul rack-ului din noul BMS, vedem imediat că modulele inferioare PDU sunt suprasolicitate (curentul total depășește cei 16A permisi, notificare „albastră”), iar cele superioare sunt subsolicitate. În cazul deconectării uneia dintre surse, toată sarcina va trece pe a doua, iar modulul inferior care rămâne sub tensiune se va deconecta din cauza suprasolicitării. Pentru a evita acest lucru, serviciul de suport al centrului de date va informa în prealabil clientul și va trimite o recomandare pentru redistribuirea sarcinii.
  • Adăugarea simplă a echipamentului. În noul BMS, senzori virtuali care sumăm curenții modulelor și puterea rack-ului sunt deja adăugați în șabloanele rack-urilor tipice și se creează automat după ce sunt adăugați în rack-ul PDU. În vechiul BMS, trebuiau creați manual și apoi plasați pe hartă, ceea ce creștea șansele de eroare din cauza „factorului uman”.
  • Spațiu nelimitat pentru creație. Acum nu avem restricții în crearea senzorilor virtuali. Putem construi orice modele matematice ale oricăror variabile. Asta înseamnă că avem posibilitatea de a crea senzori virtuali complexi (în trecut, puteam doar să adunăm valori) și de a analiza mai bine statisticile și tendințele în funcționarea sistemelor ingineresti. Acest lucru îmbunătățește calitatea deciziilor luate privind configurarea sistemelor, înlocuirea echipamentului și gestionarea resurselor. 
  • Interfață intuitivă. În noua interfață nu există aglomerare de pictograme, ventilatoarele funcționează, comutatoarele „clică”. Și cel mai convenabil este capacitatea de a indica starea PDU Line A/B în interiorul rack-urilor. Am încercat să facem ceva similar în vechiul BMS, dar numărul de pictograme care se suprapune pe centimetru pătrat de hartă ne-a făcut să renunțăm.

Acum este plăcut pentru ochi să privim:

Monitorizare în Data Center: cum am înlocuit vechiul BMS cu unul nou. Partea 3
Servere.

Monitorizare în Data Center: cum am înlocuit vechiul BMS cu unul nou. Partea 3
Fragment GRA.

Monitorizare în Data Center: cum am înlocuit vechiul BMS cu unul nou. Partea 3
Scutul de control al ventilatiei.

Și, de asemenea, noua BMS poate fi decorată pentru Anul Nou 🙂
Monitorizare în Data Center: cum am înlocuit vechiul BMS cu unul nou. Partea 3

One page – înțelegere din jumătate de cuvânt și fără specificații

De foarte mult timp ne-am dorit să implementăm încă o „trăsătură” în BMS: să adunăm pe o singură pagină parametrii principali ai centrului de date, astfel încât o simplă privire pe ecran să fie suficientă pentru a evalua starea principalelor sisteme. Totuși, nu ne-am dat seama exact cum ar trebui să arate.

Încă înainte de a începe dezvoltarea noului BMS, am vizitat, cu excursii, o duzină de centre de date în Olanda. Unul dintre obiective a fost să vedem exemple de realizare a unei asemenea pagini.

Și în niciun centru de date nu ne-au arătat-o – în unele locuri nu exista, în altele „tocmai era în dezvoltare”, iar în altele era „un mare secret comercial”. Așadar, în specificațiile noastre pentru crearea noului BMS, descrierea exactă a acestei pagini foarte importante pentru noi a lipsit.

În cele din urmă, am creat-o literalmente „pe picior” . Chiar în acel moment, a trebuit să consult îndepărtat colegii din centrul de date. A răsfoi paginile BMS pe telefon în căutarea datelor dispersate era foarte inconvenient, iar prima versiune a fost schițată practic pe un șervețel. One page. Și aceasta a fost realizată de dezvoltatori bazându-se pe fotografii. 

Urmând exemplul colegilor olandezi prudenți, nu vom demonstra varianta finală a paginii noastre principale, mai ales că fiecare centru de date este unic și nu are sens să copiem. Dar vom descrie două principii principale ale formării acesteia:

  1. Este un tabel, conceput pentru formatul ecranului vertical al telefonului mobil (sau al monitorului, dar cu menținerea orientării verticale), cu afișarea tuturor informațiilor importante pe un singur ecran. Deasupra tabelului este prezentată o „sinteză” a incidentelor active, așa că a fost cel mai convenabil să le așezăm împreună în format vertical. 
  2. Dispoziția celulelor în tabel repetă arhitectura centrului de date (fizică sau logică). Am renunțat la aranjarea sistemelor în ordine alfabetică, cum ar părea la prima vedere. Secvența reflectă asociațiile vizuale ale personalului centrului de date – ca și cum ar monitoriza fizic toate încăperile și sistemele. Acest lucru simplifică găsirea informațiilor.

În esență, acum toate caracteristicile cheie ale centrului de date sunt grupate și prezentate pe un singur ecran de smartphone sau monitor pentru inginerul responsabil și lider, având în același timp o legătură cu topografia fizică și logică a centrului de date. 

Iată fotografia acelui prim schițat, deși, bineînțeles, această versiune a fost ulterior reinterpretată și îmbunătățită.

Monitorizare în Data Center: cum am înlocuit vechiul BMS cu unul nou. Partea 3

Confirmarea și rezumatul incidentelor

Vom vorbi despre un alt concept nou pentru noi, apărut ca rezultat al proiectului de actualizare a sistemului de monitorizare.

Confirmarea este un termen destul de rar întâlnit, propus de dezvoltatorul noii BMS. Acesta înseamnă confirmarea că operatorul a observat incidentul, l-a validat și a preluat responsabilitatea pentru remedierea acestuia.  

Cuvântul s-a impus, și acum „confirmăm” incidentele.

Algoritmul încorporat în versiunea de bază a noii BMS nu ne-a mulțumit. Practic, acestea erau comentarii în jurnalul de evenimente, adică incidentele remediate nu dispăreau din jurnal, iar cele acceptate („confirmate”) nu erau separate de cele noi.

În cele din urmă, a fost dezvoltat un fereastră numită „rezumat”, în care:

  1. Sunt afișate doar incidentele active și dispozitivele în mod de service (fără notificări comerciale „albastre”).
  2. Se separă clar incidentele NOI și cele ACCEPTATE.
  3. Se indică cine a acceptat incidentul.

Algoritmul de lucru al operatorilor din noua BMS este următorul:

  1. Incidentele noi ajung în rezumat și așteaptă confirmarea. Ele nu pot sta în această secțiune mult timp, responsabilul de echipamente trebuie să preia imediat incidentul.
  2. Angajatul preia incidentul apasând pe bifa din dreapta. Deoarece toți angajații au conturi unice, se afișează automat cine a preluat incidentul. Dacă este necesar, se lasă un comentariu.
  3. Incidentul este mutat în secțiunea „Confirmate”, ceilalți operatori și liderul înțeleg că incidentul este gestionat de angajatul responsabil.

Monitorizare în Data Center: cum am înlocuit vechiul BMS cu unul nou. Partea 3
Exemplu de fereastră a rezumatului cu un mesaj nou și unul deja confirmat.

Îmbinând fereastra rezumatului cu tabelul One page, am obținut un ecran principal al sistemului BMS, pe care se poate vedea imediat: starea principalelor sisteme ale centrului de date; 

  • prezența incidentelor noi neprelucrate;
  • prezența incidentelor acceptate și date despre cine le remediează concret.
  • наличие принятых инцидентов и данные о том, кто конкретно их устраняет.

Acces prin browser și notificări pop-up pe telefon

Interfața web, accesibilă de pe orice dispozitiv din orice colț al lumii, este un contrast izbitor cu clientul „greu”, complet închis pentru utilizatorii din exterior. 

Abordarea veche aducea o serie de neplăceri, de la probleme în organizarea muncii la distanță a angajaților din serviciul de monitorizare, până la necesitatea instalării de clienți „grei” din distribuții pe locurile de muncă ale personalului din data center.

Acum, fiecare pagină din BMS are o adresă unică, ceea ce permite partajarea nu doar a adresei directe a paginii sau a dispozitivului, ci și a linkurilor către graficele/rapoartele unice. 

Accesul în sistem se realizează acum prin autentificare LDAP prin Active Directory, ceea ce sporește nivelul de securitate al acestuia. 

Mobilitatea este astăzi un factor cheie pentru buna funcționare a inginerilor de gardă. Pe lângă monitorizarea din camera de gardă, inginerii efectuează inspecții, își desfășoară activitatea departe de „gardă” și, datorită ecranului principal BMS optimizat pentru dispozitive mobile, nu își pierd niciodată controlul asupra activităților din camerele de mașini. 

Calitatea controlului este, de asemenea, îmbunătățită datorită funcționalității chat-urilor de lucru. Acestea accelerează procesele de lucru, permițând „legarea” corespondenței inginerilor de gardă de BMS. De exemplu, folosim aplicația Teams, care permet comunicarea internă și primirea pe telefon a tuturor mesajelor din BMS sub formă de notificări pop-up, eliminând necesitatea ca inginerul de gardă să verifice constant ecranul telefonului.

Monitorizare în Data Center: cum am înlocuit vechiul BMS cu unul nou. Partea 3
 Notificare pop-up pe ecranul smartphone-ului.

Monitorizare în Data Center: cum am înlocuit vechiul BMS cu unul nou. Partea 3
Așa arată notificările în aplicația Teams.

Notificările pop-up sunt configurate doar pentru mesajele despre apariția incidentelor, astfel fiind minimalizat factorul de distragere a atenției; personalul știe: dacă pe ecranul smartphone-ului apare o notificare push Teams, trebuie să acceseze pagina BMS și să accepte incidentul. Mesajele despre soluționarea incidentelor sunt urmărite deja pe pagina BMS.

Monitorizare în Data Center: cum am înlocuit vechiul BMS cu unul nou. Partea 3
În poză, interfața BMS pe smartphone.

În concluzie

Cu costurile de actualizare a BMS-ului la vechiul nostru furnizor, comparabile cu dezvoltarea unui nou sistem de la zero (aproximativ 100.000 de dolari), diferența în funcționalitatea produselor s-a dovedit a fi colosală. Am obținut un sistem flexibil, optimizat pentru sarcinile și procesele noastre de afaceri. De asemenea, am realizat economii semnificative în cheltuielile curente pentru suport și actualizarea sistemului. 

Dar, desigur, au fost și dificultăți. 

  • În primul rând, am subestimat volumul modificărilor necesare în versiunea de bază a noului BMS și nu ne-am încadrat în termenele convenite anterior. Pentru noi, aceasta nu a fost o problemă critică, deoarece ne-am protejat până în ultimul moment și am lucrat pe vechiul sistem, iar procesul a fost creativ, complex și, prin urmare, uneori a decurs mai lent decât ne-am așteptat. În plus, am văzut întotdeauna că dezvoltatorul nostru depune maxim efort pentru a atinge cel mai bun rezultat. Dar, de fapt, povestea s-a dovedit a fi foarte lungă, iar specialiștii noștri cheie au investit mult mai multe eforturi și timp decât planificaseră. 
  • În al doilea rând, a fost nevoie de mai multe etape de testare pentru a ajusta algoritmul de rezervare a mașinilor virtuale și a canalelor de comunicație. Inițial, au existat erori atât în partea sistemului BMS, cât și în setările mașinilor virtuale și rețelei. Această ajustare a durat, de asemenea, timp. Din fericire, contractorul a avut la dispoziție o platformă de testare sub forma unui serviciu cloud, unde au fost inițial testate toate setările și noutățile.
  • În al treilea rând, sistemul final s-a dovedit a fi mai complex pentru editarea de către utilizatorul final. Dacă anterior harta era un fundal (fișier grafic) și pictogramele erau ușor de modificat sau mutat, acum acesta este o interfață grafică complexă cu animație, care necesită abilități specifice pentru editare.

Actualizarea radicală a sistemului nostru BMS poate fi acum considerată cel mai important proiect al anului trecut, care va influența semnificativ calitatea managementului operațiunilor platformelor noastre în viitor. 

Nu am aruncat, desigur, vechiul server de fier, ci l-am "ușurat": am curățat de mii de senzori virtuali "comerciali" și PDU și am lăsat doar câteva zeci dintre cele mai critice dispozitive, cum ar fi DG, UPS, aer condiționat, pompe, senzori de scurgere și temperatură. În acest mod, serverul a recuperat viteza sa anterioară și poate deveni un "rezervă de rezervă". Apropo, după eliminarea PDU din vechea BMS, am eliberat aproximativ 1000 de licențe acum inutile, nu cumva știți ce să facem cu ele?

Sursa: habr.com

Cumpără un hosting fiabil pentru site-uri cu protecție DDoS, servere VPS VDS 🔥 Cumpără un hosting fiabil pentru site-uri cu protecție DDoS, servere VPS VDS | ProHoster