Prvá stabilná verzia IncidentRelay, systému na organizovanie služieb a smerovanie upozornení

Po piatich mesiacoch vývoja bol vydaný IncidentRelay 1.1. Vyvíja open-source systém pre správu pohotovostí, smerovanie upozornení a reakciu na incidenty, ktorý beží na samostatne hostovanom serveri. IncidentRelay 1.1 je označená ako prvá stabilná verzia (vetva 1.0 bola v beta verzii). Projekt je určený pre SRE, DevOps a infraštruktúrne tímy, ktoré hľadajú lokálne nasadenú alternatívu k SaaS službám pre správu pohotovostí, eskalačné politiky a reakciu na incidenty. Kód projektu je napísaný v jazyku Python a distribuovaný pod licenciou MIT.

IncidentRelay prijíma udalosti z monitorovacích systémov, porovnáva ich so službou, tímom a rotáciou a potom doručuje oznámenia zodpovedným službukonajúcim dôstojníkom alebo tímom. Systém implementuje rozvrhy služieb, rotácie, prepísanie zmien, potvrdenie incidentov, stav ACK/Resolve, pripomienky, eskalácie, dočasné výmeny službukonajúcich dôstojníkov, plánované časy údržby a potlačenie upozornení.

Hlavnou výhodou projektu je úplná kontrola nad infraštruktúrou a logikou smerovania. IncidentRelay je nasadený vo vlastnom prostredí, pracuje s vlastnou databázou a umožňuje explicitné oddelenie prichádzajúcich trás, príkazov, rotácií a doručovacích kanálov. Prichádzajúce tokeny patria k trasám, nie kanálom, čo uľahčuje pochopenie toho, ktorý externý zdroj má povolenie odosielať udalosti do konkrétneho príkazu.

IncidentRelay podporuje prijímanie udalostí z Prometheus Alertmanager, Grafana Alerting, Zabbix, Sentry, LibreNMS, RMON, AWS SNS/CloudWatch a vlastných webhookov. Upozornenia je možné odosielať prostredníctvom Mattermostu, Slacku, Telegramu, Discordu, Microsoft Teamsu, e-mailu, webhookov, push správ prehliadača/PWA a poskytovateľov hlasových hovorov. V Mattermoste a Telegrame môžu upozornenia obsahovať akcie na potvrdenie a vyriešenie problému, čo umožňuje riešiť incidenty bez prepínania do samostatného rozhrania.

Projekt je možné spustiť cez Docker Compose, RPM balík pre distribúcie podobné Red Hatu, manuálne cez systemd alebo v Kubernetes pomocou Helm chart. SQLite je možné použiť pre malé inštalácie, zatiaľ čo PostgreSQL sa odporúča pre produkčné prostredia a vyššie zaťaženie.

Nová verzia navrhuje nasledujúce zmeny:

  • Pridané viacúrovňové rotácie pohotovostí s časovými obmedzeniami, prioritami vrstiev a zohľadnením dočasných náhrad;
  • Objavil sa kalendár povinností, predplatné CalDAV a ICS pre externé kalendáre;
  • Implementované politiky eskalácie incidentov s viacstupňovými eskalačnými reťazcami;
  • Pridané skupiny upozornení, zoskupovanie udalostí, oneskorené upozornenia a manuálne zlúčenie súvisiacich upozornení;
  • Objavili sa okná pre naplánovanú prácu a „tiché“ upozornenia;
  • Pridaná možnosť pridávať komentáre k upozorneniam;
  • Pridané priority incidentov (P1-P5) a automatická eskalácia priorít na základe úrovne dôležitosti;
  • Implementovaný katalóg služieb, závislosti služieb, SLI/SLO, história vplyvov služieb a obchodné služby;
  • Bola pridaná funkcia Vysvetliť sledovanie na analýzu smerovania: prečo bolo alebo nebolo upozornenie zahrnuté do príkazu, bolo zoskupené, potlačené alebo odoslané na konkrétny kanál;
  • Pridané kontroly (Heartbeats/dead-man-switch) pre watchdog, zálohovanie, ETL a ďalšie úlohy, kde je problémom absencia očakávaného signálu.



Zdroj: opennet.ru
Kúpte si spoľahlivý hosting pre stránky s DDoS ochranou, VPS VDS servery 🔥 Kúpte si spoľahlivý webhosting s ochranou DDoS, VPS VDS servery | ProHoster