IncidentRelay esimene stabiilne väljalase, süsteem jälgimise korraldamiseks ja häirete suunamiseks

Pärast viie kuu arendust on välja antud projekti IncidentRelay 1.1 väljaanne, mis arendab avatud süsteemi vahetuste, häirete suunamise ja intsidentide haldamise korraldamiseks, mida käitatakse oma serveris (self-hosted). IncidentRelay 1.1 on märgitud kui esimene stabiilne väljaanne (versioon 1.0 oli beetaversioon). Projekt on suunatud SRE, DevOps ja infrastruktuurimeeskondadele, kes vajavad kohalikult juurutatavat alternatiivi SaaS-teenustele vahetuste haldamiseks, eskalatsioonipoliitikate rakendamiseks ja intsidentide käsitlemiseks. Projekti kood on kirjutatud Pythonis ja seda levitatakse MIT litsentsi alusel.

IncidentRelay võtab vastu sündmusi monitooringusüsteemidest, seab need vastavusse teenuse, meeskonna ja rotatsiooniga ning edastab seejärel teavitused vastutavatele vahetusele või meeskondadele. Süsteem sisaldab vahetuste, rotatsioonide, vahetuste ühtluste ja kinnituse haldamise ajakavasid, ACK/Resolve olekute, meenutuste, eskalatsiooni, ajutiste asenduste määramise, planeeritud tööde kestuse määramise ja lärmakate häiresignaalide summutamise võimalusi.

Projekti peamine eelis on täielik kontroll infrastruktuuri ja marsruutimise logika üle. IncidentRelay toimub oma keskkonnas, töötab oma andmebaasiga ja võimaldab selgelt eristada sissetulevaid marsruute, käske, rotatsiooni ja kohaletoimetamise kanaleid. Sissetulevad tokeneid kuuluvad marsruutidele, mitte kanalitele, mistõttu on lihtsam mõista, milline väline allikas on volitatud sündmusi konkreetsele käsule saatma.

IncidentRelay toetab sündmuste vastuvõttu Prometheus Alertmanagerilt, Grafana Alerting'ilt, Zabbixilt, Sentry'lt, LibreNMS'ilt, RMONilt, AWS SNS/CloudWatch'ilt ja mistahes webhook'idelt. Teavituste saatmiseks on ette nähtud kanalid nagu Mattermost, Slack, Telegram, Discord, Microsoft Teams, e-post, webhook'id, brauseri/PWA push ja häälekõnede teenusepakkujad. Mattermostis ja Telegramis võivad teavitused sisaldada toiminguid kinnitamiseks ja probleemide lahendamiseks, mis võimaldab sündmuse lahendamist ilma eraldi liidesesse minemata.

Projekti saab käivitada Docker Compose'i, RPM-paketi kaudu Red Hati-sarnastes distributsioonides, käsitsi systemd kaudu, samuti Kuberneteses Helm-chart'i abil. Väikeste paigalduste jaoks võib kasutada SQLite'd, samas soovitatakse töösüsteemide ja suurema koormuse korral PostgreSQL'i.

Uues versioonis on tehtud järgmised muudatused:

  • Lisatud on mitme taseme hädaabikordinaatorid, mis arvestavad ajapiiranguid, prioriteete ja ajutisi asendusi;
  • Paaridega on saadaval valvekalendar, CalDAV ja ICS-i tellimused välistes kalendrites;
  • Rakendatud on probleemide eskalatsioonipoliitikad mitmeastmeliste tõstmise ahelatega;
  • Lisatud on hoiatuste grupid, sündmuste rühmitamine, edasilükatud teated ja käeline seotud hoiatuste ühinemine;
  • Töid teostamiseks on lisatud aknad ning 'vaiksed' hoiatused;
  • Lisatud on võimalus lisada kommentaare hoiatustele;
  • Lisatud on probleemide prioriteedid (P1-P5) ja automaatne prioriteedi tõstmine tähtsuse alusel;
  • Rakendatud on teenuste kataloog, teenuste sõltuvused, SLI/SLO, süsteemide töö mõjutamise ajalugu (Service Impact History) ja äriteenused (Business Services);
  • Lisatud on Explain Trace marsruutimise analüüsiks: miks hoiatus jõudis või ei jõudnud meeskonda, kas see rühmitati, mahasurutud või saadetud kindlasse kanalisse;
  • Lisatud on kontrollid (Heartbeats/dead-man-switch) watchdogi, varukoopia, ETL ja muude ülesannete jaoks, kus probleemiks on oodatava signaali puudumine.



Allikas: opennet.ru
Osta usaldusväärne veebihosting DDoS kaitsega, VPS VDS serverid 🔥 Osta usaldusväärne veebihosting DDoS kaitsega, VPS VDS serverid | ProHoster