První stabilní verze IncidentRelay, systému pro organizaci služeb a směrování upozornění

Po pěti měsících vývoje byl vydán IncidentRelay 1.1. Vyvíjí open-source systém pro správu pohotovostí, směrování upozornění a reakci na incidenty, běžící na vlastním serveru. IncidentRelay 1.1 je označena jako první stabilní verze (větev 1.0 byla v beta verzi). Projekt je zaměřen na SRE, DevOps a infrastrukturní týmy, které hledají lokálně nasazenou alternativu k SaaS službám pro správu pohotovostí, eskalační politiky a reakci na incidenty. Kód projektu je napsán v Pythonu a distribuován pod licencí MIT.

IncidentRelay přijímá události z monitorovacích systémů, porovnává je se službou, týmem a rotací a poté doručuje oznámení odpovědným službukonajícím důstojníkům nebo týmům. Systém implementuje rozvrhy služeb, rotace, přepsání směn, potvrzení incidentů, stav ACK/Resolve, připomenutí, eskalace, dočasné nahrazení službukonajících důstojníků, plánované časy údržby a potlačení výstrah.

Hlavní výhodou projektu je úplná kontrola nad infrastrukturou a logikou směrování. IncidentRelay je nasazen ve vlastním prostředí, pracuje s vlastní databází a umožňuje explicitní oddělení příchozích tras, příkazů, rotací a doručovacích kanálů. Příchozí tokeny patří trasám, nikoli kanálům, což usnadňuje pochopení, který externí zdroj má oprávnění odesílat události konkrétnímu příkazu.

IncidentRelay podporuje příjem událostí z Prometheus Alertmanager, Grafana Alerting, Zabbix, Sentry, LibreNMS, RMON, AWS SNS/CloudWatch a vlastních webhooků. Oznámení lze odesílat prostřednictvím Mattermostu, Slacku, Telegramu, Discordu, Microsoft Teamsu, e-mailu, webhooků, push oznámení v prohlížeči/PWA a poskytovatelů hlasových hovorů. V Mattermostu a Telegramu mohou oznámení obsahovat akce pro potvrzení a vyřešení problému, což umožňuje řešit incidenty bez nutnosti přepínání na samostatné rozhraní.

Projekt lze spustit přes Docker Compose, RPM balíček pro distribuce podobné Red Hatu, ručně přes systemd nebo v Kubernetes pomocí Helm chart. SQLite lze použít pro malé instalace, zatímco PostgreSQL se doporučuje pro produkční prostředí a vyšší zátěž.

Nová verze navrhuje následující změny:

  • Přidány víceúrovňové rotace pohotovosti s časovými limity, prioritami vrstev a zohledněním dočasných náhrad;
  • Objevil se kalendář služeb, předplatné CalDAV a ICS pro externí kalendáře;
  • Implementované zásady eskalace incidentů s vícekrokovými eskalačními řetězci;
  • Přidány skupiny upozornění, seskupování událostí, zpožděná oznámení a ruční slučování souvisejících upozornění;
  • Objevila se okna pro naplánovanou práci a „tichá“ upozornění;
  • Přidána možnost přidávat komentáře k upozorněním;
  • Přidány priority incidentů (P1-P5) a automatická eskalace priorit na základě úrovně důležitosti;
  • Implementovaný katalog služeb, závislosti služeb, SLI/SLO, historie dopadů služeb a obchodní služby;
  • Byla přidána funkce Vysvětlení trasování pro analýzu směrování: proč byla nebo nebyla výstraha zahrnuta do příkazu, byla seskupena, potlačena nebo odeslána na konkrétní kanál;
  • Přidány kontroly (prezenční signál/dead-man-switch) pro watchdog, zálohování, ETL a další úlohy, kde je problémem absence očekávaného signálu.



Zdroj: opennet.ru
Kupte si spolehlivý hosting pro stránky s DDoS ochranou, VPS VDS servery 🔥 Kupte si spolehlivý webhosting s ochranou DDoS, VPS VDS servery | ProHoster