Pas pesë muajsh zhvillimi, është publikuar versioni 1.1 i projektit IncidentRelay, i cili zhvillon një sistem të hapur për organizimin e turneve, përshpejtimin e njoftimeve dhe mbështetje për incidente, i vendosur në serverin e tij (self-hosted). IncidentRelay 1.1 shënohet si versioni i parë stabil (dega 1.0 kishte statusin e beta-versionit). Projekti është orientuar për ekipet SRE, DevOps dhe infrastrukturore që kërkojnë një alternativë lokalisht të instaluar për shërbimet SaaS për menaxhimin e turneve, aplikimin e politikave të eskalimit dhe reagimin ndaj incidenteve. Kodi i projektit është shkruar në Python dhe shpërndahet nën licencën MIT.
IncidentRelay pranon ngjarje nga sistemet e monitorimit, i përputh ato me shërbimin, ekipin dhe rotacionin, pastaj dërgon njoftime tek turnet përgjegjës ose ekipet. Në sistem janë realizuar orarët e turneve, rotacionet, ribotimi i ndërrimeve, konfirmimi i marrjes së incidentit, gjendjet ACK/Resolve, kujtimet, eskalimet, zëvendësimet përkohësore të turneve, përcaktimi i kohës për punët e planifikuara dhe shtypja e alarmeve të zhurmshme.
Avantazhi kryesor i projektit është kontrolli i plotë mbi infrastrukturën dhe logjikën e përshpejtimit. IncidentRelay vendoset në mjedisin e tij, punon me bazën e saj të të dhënave dhe lejon ndarjen e qartë të rrugëve hyrëse, ekipeve, rotacioneve dhe kanaleve të dorëzimit. Tokenat hyrëse i përkasin rrugëve dhe jo kanaleve, kështu që është më e thjeshtë të kuptojmë se cili burim i jashtëm ka të drejtat për të dërguar ngjarje në një ekip të caktuar.
IncidentRelay mbështet pranimin e ngjarjeve nga Prometheus Alertmanager, Grafana Alerting, Zabbix, Sentry, LibreNMS, RMON, AWS SNS/CloudWatch dhe webhook-e të rastësishëm. Për dërgimin e njoftimeve janë parashikuar kanale si Mattermost, Slack, Telegram, Discord, Microsoft Teams, email, webhook-e, dërgime të shfletuesit/PWA dhe ofrues të thirrjeve vokale. Në Mattermost dhe Telegram, njoftimet mund të përmbajnë veprime për konfirmimin dhe zgjidhjen e problemeve, çka lejon trajtimin e incidentit pa kaluar në një ndërfaqe të veçantë.
Projekti mund të niset përmes Docker Compose, paketës RPM për shpërndarjet e ngjashme me Red Hat, dorazi përmes systemd, si dhe në Kubernetes duke përdorur Helm-chart. Për instalime të vogla, mund të përdoret SQLite, ndërsa për sistemet e punës dhe ngarkesat më të larta, rekomandohet PostgreSQL.
Në versionin e ri janë propozuar këto ndryshime:
- Shtuar rotacione on-call me shumë nivele me kufizime në kohë, prioritete të niveleve dhe marrjen parasysh të zëvendësimeve të përkohshme;
- ĂshtĂ« krijuar njĂ« kalendar turnesh, CalDAV dhe abonime ICS pĂ«r kalendare tĂ« jashtme;
- Janë realizuar politika për eskalimin e incidenteve me zinxhirë ndihme shumëshkallëshe;
- Shtuar grupe paralajmërimesh, grupimi i ngjarjeve, njoftime të shtyra dhe bashkimin manual të alerteve të lidhura;
- Janë shtuar dritaret për kryerjen e punimeve të planifikuara dhe 'alerte të qeta';
- Shtuar mundësia për të shtuar komente në alerte;
- Shtuar prioritetet e incidenteve (P1-P5) dhe rritja automatike e prioritetit sipas nivelit të rëndësisë;
- Janë realizuar katalogu i shërbimeve, varësitë e shërbimeve, SLI/SLO, historia e ndikimit në funksionimin e sistemeve (Service Impact History) dhe shërbimet biznesore (Business Services);
- Janë shtuar Explain Trace për shpjegimin e rrugëve: pse një alert arriti ose nuk arriti në ekip, u grupua, u ndal ua dërgua në një kanal të caktuar;
- Shtuar kontrollesh (Heartbeats/dead-man-switch) për watchdog, backup, ETL dhe detyra të tjera, ku problemi është mungesa e sinjalit të pritur.


Burimi: opennet.ru
