Po petih mesecih razvoja je izšel IncidentRelay 1.1. Razvija odprtokodni sistem za upravljanje dežurstva, usmerjanje opozoril in odzivanje na incidente, ki deluje na samostojno gostovanem strežniku. IncidentRelay 1.1 je označen kot prva stabilna izdaja (veja 1.0 je bila v beta različici). Projekt je namenjen strokovnjakom za socialno delo (SRE), razvijalcem za razvoj (DevOps) in infrastrukturnim ekipam, ki iščejo lokalno nameščeno alternativo storitvam SaaS za upravljanje dežurstva, politike eskalacije in odzivanje na incidente. Koda projekta je napisana v Pythonu in distribuirana pod licenco MIT.
IncidentRelay prejema dogodke iz nadzornih sistemov, jih primerja s storitvijo, ekipo in rotacijo ter nato posreduje obvestila odgovornim dežurnim častnikom ali ekipam. Sistem izvaja urnike dežurstva, rotacije, preglasitve izmen, potrditev incidentov, status ACK/Reševanje, opomnike, eskalacije, začasne zamenjave dežurnih častnikov, načrtovane čase vzdrževanja in zatiranje opozoril.
Glavna prednost projekta je popoln nadzor nad infrastrukturo in logiko usmerjanja. IncidentRelay je nameščen v svojem okolju, deluje z lastno bazo podatkov in omogoča eksplicitno ločevanje vhodnih poti, ukazov, rotacij in dostavnih kanalov. Vhodni žetoni pripadajo potem, ne kanalom, kar olajša razumevanje, kateri zunanji vir ima dovoljenje za pošiljanje dogodkov določenemu ukazu.
IncidentRelay podpira prejemanje dogodkov iz Prometheus Alertmanager, Grafana Alerting, Zabbix, Sentry, LibreNMS, RMON, AWS SNS/CloudWatch in prilagojenih spletnih kavljarjev. Obvestila je mogoče poslati prek Mattermosta, Slacka, Telegrama, Discorda, Microsoft Teamsa, e-pošte, spletnih kavljarjev, potisnih sporočil brskalnika/PWA in ponudnikov glasovnih klicev. V Mattermostu in Telegramu lahko obvestila vključujejo dejanja za potrditev in rešitev težave, kar omogoča obravnavo incidentov brez preklopa na ločen vmesnik.
Projekt je mogoče zagnati prek Docker Compose, paketa RPM za distribucije, podobne Red Hatu, ročno prek systemd ali v Kubernetes z uporabo Helm grafikona. SQLite se lahko uporablja za manjše namestitve, medtem ko je PostgreSQL priporočljiv za produkcijska okolja in večje obremenitve.
Nova različica predlaga naslednje spremembe:
- Dodane večnivojske rotacije dežurstva s časovnimi omejitvami, prioritetami slojev in upoštevanjem začasnih zamenjav;
- Pojavili so se koledar služb ter naročnine na CalDAV in ICS za zunanje koledarje;
- Izvedene politike eskalacije incidentov z večstopenjskimi eskalacijskimi verigami;
- Dodane skupine opozoril, združevanje dogodkov, zakasnjena obvestila in ročno združevanje povezanih opozoril;
- Pojavila so se okna za načrtovano delo in »tiha« opozorila;
- Dodana je možnost dodajanja komentarjev k opozorilom;
- Dodane prioritete incidentov (P1-P5) in samodejno stopnjevanje prioritet glede na stopnjo pomembnosti;
- Implementiran katalog storitev, odvisnosti storitev, SLI/SLO, zgodovina vplivov storitev in poslovne storitve;
- Dodana je bila možnost »Pojasni sled« za analizo usmerjanja: zakaj je bilo opozorilo vključeno v ukaz, zakaj ni bilo, zakaj je bilo združeno, potlačeno ali poslano na določen kanal;
- Dodani pregledi (srčni utripi/mrtvi mehanizem) za nadzor, varnostno kopiranje, ETL in druge naloge, kjer je težava odsotnost pričakovanega signala.


Vir: opennet.ru
