Nakon pet mjeseci razvoja, objavljen je IncidentRelay 1.1. Razvija sistem otvorenog koda za upravljanje dežurstvima, usmjeravanje upozorenja i odgovor na incidente, koji radi na samostalno hostovanom serveru. IncidentRelay 1.1 označen je kao prvo stabilno izdanje (grana 1.0 bila je u beta verziji). Projekat je namijenjen SRE-ovima, DevOps-ima i infrastrukturnim timovima koji traže lokalno implementiranu alternativu SaaS uslugama za upravljanje dežurstvima, politike eskalacije i odgovor na incidente. Kod projekta je napisan u Pythonu i distribuiran pod MIT licencom.
IncidentRelay prima događaje iz sistema za nadzor, upoređuje ih sa službom, timom i rotacijom, a zatim dostavlja obavještenja odgovornim dežurnim službenicima ili timovima. Sistem implementira rasporede dužnosti, rotacije, poništavanje smjena, potvrdu incidenata, status ACK/Resolve, podsjetnike, eskalacije, privremene zamjene dežurnih službenika, planirana vremena održavanja i suzbijanje upozorenja.
Glavna prednost projekta je potpuna kontrola nad infrastrukturom i logikom usmjeravanja. IncidentRelay je implementiran u vlastitom okruženju, radi sa vlastitom bazom podataka i omogućava eksplicitno odvajanje dolaznih ruta, komandi, rotacija i kanala isporuke. Dolazni tokeni pripadaju rutama, a ne kanalima, što olakšava razumijevanje koji vanjski izvor ima dozvolu za slanje događaja određenoj komandi.
IncidentRelay podržava primanje događaja od Prometheus Alertmanagera, Grafana Alertinga, Zabbixa, Sentryja, LibreNMS-a, RMON-a, AWS SNS/CloudWatcha i prilagođenih webhookova. Obavještenja se mogu slati putem Mattermosta, Slacka, Telegrama, Discorda, Microsoft Teamsa, e-pošte, webhookova, push obavijesti preglednika/PWA i provajdera glasovnih poziva. U Mattermostu i Telegramu, obavještenja mogu uključivati radnje za potvrdu i rješavanje problema, omogućavajući rješavanje incidenata bez prelaska na zaseban interfejs.
Projekat se može pokrenuti putem Docker Compose-a, RPM paketa za distribucije slične Red Hat-u, ručno putem systemd-a ili u Kubernetes-u korištenjem Helm grafikona. SQLite se može koristiti za male instalacije, dok se PostgreSQL preporučuje za produkcijska okruženja i veća opterećenja.
Nova verzija predlaže sljedeće promjene:
- Dodane višeslojne rotacije dežurstva s vremenskim ograničenjima, prioritetima slojeva i razmatranjem privremenih zamjena;
- Pojavili su se kalendar dužnosti, CalDAV i ICS pretplate za vanjske kalendare;
- Implementirane politike eskalacije incidenata s višekoračnim lancima eskalacije;
- Dodane grupe upozorenja, grupisanje događaja, odgođena obavještenja i ručno spajanje povezanih upozorenja;
- Pojavili su se prozori za zakazani rad i „tiha“ upozorenja;
- Dodana je mogućnost dodavanja komentara na upozorenja;
- Dodani prioriteti incidenata (P1-P5) i automatska eskalacija prioriteta na osnovu nivoa važnosti;
- Implementiran katalog servisa, zavisnosti servisa, SLI/SLO, historija uticaja servisa i poslovne servise;
- Dodat je Explain Trace za analizu usmjeravanja: zašto je upozorenje bilo ili nije bilo uključeno u komandu, zašto je grupisano, potisnuto ili poslano na određeni kanal;
- Dodane provjere (otkucaji srca/prekidač za detekciju stanja mirovanja) za watchdog, backup, ETL i druge zadatke gdje je problem odsustvo očekivanog signala.


izvor: opennet.ru
