Esimene stabiilne väljaanne IncidentRelay, süsteem dežuuride korraldamiseks ja teavituste suunamiseks

Pärast viie kuu arendust on avaldatud projekti IncidentRelay 1.1 väljaanne, mis arendab avatud süsteemi valvureid, teavituste suunamist ja sündmuste haldamist, mida käitatakse oma serveris (self-hosted). IncidentRelay 1.1 tähistab esimest stabiilset väljaannet (versioon 1.0 oli beetaversioon). Projekt on suunatud SRE, DevOps ja infrastruktuuri meeskondadele, kes vajavad lokaalset alternatiivi SaaS teenustele hädaolukordade haldamiseks (on-call management), eskaleerimise poliitikate rakendamiseks ja sündmustele reageerimiseks. Projekti kood on kirjutatud Pythonis ja see levitatakse MIT litsentsi alusel.

IncidentRelay võtab vastu sündmusi monitooringusüsteemidelt, seostab need teenuse, meeskonna ja vahetustega ning toimetab teated vastutavatele valvuritele või meeskondadele. Süsteem sisaldab vahetusgraafikuid, vahetuste rotatsiooni, vahetuste ülekirjutamist, sündmuste saamise kinnitamist, ACK/Resolve olekuid, meeldetuletusi, eskaleerimisi, ajutiste asenduste määramist, plaaniliste tööde ajakava määramist ja müra tekitavate alarmide summutamist.

Projekti peamine eelis on täielik kontroll infrastruktuuri ja suunamislogika üle. IncidentRelay paigaldatakse oma keskkonda, töötab oma andmebaasiga ning võimaldab selgelt eristada sissetulevaid marsruute, meeskondi, rotatsioone ja edastamiskanaleid. Sissetulevad tokenid kuuluvad marsruutidele, mitte kanalitele, mistõttu on lihtsam mõista, milline väline allikas on volitatud sündmusi konkreetse meeskonnaga saatma.

IncidentRelay toetab sündmuste vastuvõttu Prometheus Alertmanagerist, Grafana Alertingust, Zabbixist, Sentryst, LibreNMS-st, RMON-ist, AWS SNS/CloudWatch-st ja mis tahes webhook'idest. Teadete saatmiseks on saadaval kanalid Mattermost, Slack, Telegram, Discord, Microsoft Teams, e-post, webhook'id, brauseri/PWA push ja häälekõnede pakkujad. Mattermostis ja Telegramis võivad teated sisaldada tegevusi probleemide kinnitamiseks ja lahendamiseks, mis võimaldab sündmuse käsitlemist ilma eraldi liidesesse minemata.

Projekti saab käivitada Docker Compose'i, RPM-paketi kaudu Red Hat'i sarnaste jaotuste jaoks, käsitsi systemd kaudu, samuti Kuberneteses Helm chart'i abil. Väikeste installatsioonide jaoks võib kasutada SQLite-d, tööde süsteemide ja suure koormuse korral on soovitatav PostgreSQL.

Uues versioonis on pakutud järgmised muudatused:

  • Lisatud on mitmeastmelised on-call rotatsioonid ajapiirangute, taseme prioriteetide ja ajutiste asenduste arvestamisega;
  • Saadaval on valvekalender, CalDAV ja ICS-teenuse tellimused välistest kalendritest;
  • Rakendatud on incidentide eskaleerimise poliitikad mitmeastmeliste tasemete tõstmisega;
  • Lisatud on hoiatuste grupid, sündmuste grupeerimine, edasi lükatud teated ja seotud hoiatusi käsitsi liitmine;
  • Saadaval on aknad planeeritud tööde korraldamiseks ja „vaiksed“ hoiatused;
  • Lisatud on võimalus kommentaare hoiatustele lisada;
  • Lisatud on incidentide prioriteedid (P1-P5) ja automaatne prioriteedi tõstmine olulisuse järgi;
  • Rakendatud on teenuse kataloog, teenuste sõltuvused, SLI/SLO, süsteemide tegevuse ajaloo jälgimine (Service Impact History) ja äriteenused (Business Services);
  • Saadaval on Explain Trace marsruutimise analüüsimiseks: miks hoiatus jõudis või ei jõudnud meeskonda, kas see oli grupeeritud, allasurutud või saadetud konkreetsesse kanalisse;
  • Lisatud on kontrollid (Heartbeats/dead-man-switch) watchdog'i, backup'i, ETL-i ja muude ülesannete jaoks, kus probleemiks on oodatava signaali puudumine.



Allikas: opennet.ru
Osta usaldusväärne veebimajutus DDoS-kaitsega veebisaitidele, VPS VDS serverid 🔥 Osta usaldusväärne veebimajutus DDoS-kaitsega veebisaitidele, VPS VDS serverid - ProHoster