Pas pesë muajsh zhvillimi, është publikuar lëshimi i projektit IncidentRelay 1.1, që zhvillon një sistem të hapur për organizimin e turneve, ruterin e njoftimeve dhe mbështetje për incidentet, i cili nis në serverin tuaj (self-hosted). IncidentRelay 1.1 shënohet si lëshimi i parë stabil (dega 1.0 kishte statusin e beta-versionit). Projekti është orientuar për SRE, DevOps dhe ekipet e infrastrukturës, të cilëve u nevojitet një alternativë e zhvillueshme vendore ndaj shërbimeve SaaS për menaxhimin e turneve (on-call management), zbatimin e politikave të eskalimit dhe reagimin ndaj incidenteve. Kodi i projektit është shkruar në Python dhe shpërndahet nën licencën MIT.
IncidentRelay merr njëmendësi nga sistemet e monitorimit, duke i krahasuar ato me shërbimin, ekipin dhe rotacionin, pas së cilës dërgon njoftime për përgjegjësit e turneve ose ekipet. Në sistem janë realizuar oraret e turneve, rotacionet, përcaktimet e ndryshimeve, konfirmimi i marrjes së incidentit, statuset ACK/Resolve, kujtesat, eskalimet, zëvendësimet e përkohshme të kujdestarëve, përcaktimi i kohës për punë të planifikuara dhe suprimimi i alarmeve të zhurmshme.
Përparësia kryesore e projektit është kontrolli i plotë mbi infrastrukturën dhe logjikën e rrugëzimit. IncidentRelay vendoset në mjedisin e vet, funksionon me bazën e të dhënave të vet dhe lejon ndarjen e qartë të rrugëve hyrëse, ekipeve, rotacioneve dhe kanaleve të dërgimit. Tokenat hyrëse i përkasin rrugëve, jo kanaleve, prandaj është më e lehtë të kuptohet se cili burim i jashtëm ka të drejtën të dërgojë ngjarje në një ekip të caktuar.
IncidentRelay mbështet pranimin e ngjarjeve nga Prometheus Alertmanager, Grafana Alerting, Zabbix, Sentry, LibreNMS, RMON, AWS SNS/CloudWatch dhe webhook-e të rastit. Kanale për dërgimin e njoftimeve përfshijnë Mattermost, Slack, Telegram, Discord, Microsoft Teams, email, webhook-e, push njoftime për browser/PWA dhe ofrues të thirrjeve telefonike. Në Mattermost dhe Telegram, njoftimet mund të përmbajnë veprime për konfirmim dhe zgjidhje të problemeve, duke lejuar trajtimin e incidentit pa kaluar në një ndërfaqe të veçantë.
Projekti mund të lancuar përmes Docker Compose, RPM-paketës për distribucione të ngjashme me Red Hat, manualisht përmes systemd, si dhe në Kubernetes me ndihmën e Helm-chart. Për instalime të vogla mund të përdoret SQLite, ndërsa për sisteme të punës dhe ngarkesa më të larta rekomandohet PostgreSQL.
Në versionin e ri, propozohet këto ndryshime:
- Shtuar rotacionet e on-call me shumë nivele, kufizime në kohë, prioritete të niveleve dhe llogaritjen e zëvendësimeve përkatëse;
- U krijua një kalendar për detyrat, CalDAV dhe abone ICS për kalendare të jashtme;
- Janë zbatuar politikat e eskalimit të incidenteve me zinxhirë të shumëfishta për ngritjen e nivelit;
- Shtohen grupet e paralajmërimeve, grupimi i ngjarjeve, njoftimet e vonuara dhe bashkimi manual i alerteve të lidhura;
- Janë shtuar dritaret për zhvillimin e punimeve të planifikuara dhe alerte 'të qeta';
- Shtohet mundësia e shtimit të komenteve në alerte;
- Shtohen prioritetet e incidenteve (P1-P5) dhe rritja automatike e prioritetit në përputhje me nivelin e rëndësisë;
- Janë realizuar katalogu i shërbimeve, varësitë e shërbimeve, SLI/SLO, historia e ndikimit në funksionimin e sistemeve (Service Impact History) dhe shërbimet e biznesit (Business Services);
- Shfaqet Explain Trace për analizimin e rrugëzimit: pse alerta arriti ose nuk arriti në ekip, u grupua, u shtyp ose u dërgua në një kanal të caktuar;
- Shtohen kontrollet (Heartbeats/dead-man-switch) për watchdog, backup, ETL dhe detyra të tjera, ku problemi është mungesa e sinjalit të pritur.


Burimi: opennet.ru
