Lëshimi i parë stabil i IncidentRelay, një sistem për organizimin e turneve dhe ruterin e njoftimeve.

Pas pesë muajsh zhvillimi, është publikuar lëshimi i projektit IncidentRelay 1.1, që zhvillon një sistem të hapur për organizimin e turneve, ruterin e njoftimeve dhe mbështetje për incidentet, i cili nis në serverin tuaj (self-hosted). IncidentRelay 1.1 shënohet si lëshimi i parë stabil (dega 1.0 kishte statusin e beta-versionit). Projekti është orientuar për SRE, DevOps dhe ekipet e infrastrukturës, të cilëve u nevojitet një alternativë e zhvillueshme vendore ndaj shërbimeve SaaS për menaxhimin e turneve (on-call management), zbatimin e politikave të eskalimit dhe reagimin ndaj incidenteve. Kodi i projektit është shkruar në Python dhe shpërndahet nën licencën MIT.

IncidentRelay merr njëmendësi nga sistemet e monitorimit, duke i krahasuar ato me shërbimin, ekipin dhe rotacionin, pas së cilës dërgon njoftime për përgjegjësit e turneve ose ekipet. Në sistem janë realizuar oraret e turneve, rotacionet, përcaktimet e ndryshimeve, konfirmimi i marrjes së incidentit, statuset ACK/Resolve, kujtesat, eskalimet, zëvendësimet e përkohshme të kujdestarëve, përcaktimi i kohës për punë të planifikuara dhe suprimimi i alarmeve të zhurmshme.

Përparësia kryesore e projektit është kontrolli i plotë mbi infrastrukturën dhe logjikën e rrugëzimit. IncidentRelay vendoset në mjedisin e vet, funksionon me bazën e të dhënave të vet dhe lejon ndarjen e qartë të rrugëve hyrëse, ekipeve, rotacioneve dhe kanaleve të dërgimit. Tokenat hyrëse i përkasin rrugëve, jo kanaleve, prandaj është më e lehtë të kuptohet se cili burim i jashtëm ka të drejtën të dërgojë ngjarje në një ekip të caktuar.

IncidentRelay mbështet pranimin e ngjarjeve nga Prometheus Alertmanager, Grafana Alerting, Zabbix, Sentry, LibreNMS, RMON, AWS SNS/CloudWatch dhe webhook-e të rastit. Kanale për dërgimin e njoftimeve përfshijnë Mattermost, Slack, Telegram, Discord, Microsoft Teams, email, webhook-e, push njoftime për browser/PWA dhe ofrues të thirrjeve telefonike. Në Mattermost dhe Telegram, njoftimet mund të përmbajnë veprime për konfirmim dhe zgjidhje të problemeve, duke lejuar trajtimin e incidentit pa kaluar në një ndërfaqe të veçantë.

Projekti mund të lancuar përmes Docker Compose, RPM-paketës për distribucione të ngjashme me Red Hat, manualisht përmes systemd, si dhe në Kubernetes me ndihmën e Helm-chart. Për instalime të vogla mund të përdoret SQLite, ndërsa për sisteme të punës dhe ngarkesa më të larta rekomandohet PostgreSQL.

Në versionin e ri, propozohet këto ndryshime:

  • Shtuar rotacionet e on-call me shumĂ« nivele, kufizime nĂ« kohĂ«, prioritete tĂ« niveleve dhe llogaritjen e zĂ«vendĂ«simeve pĂ«rkatĂ«se;
  • U krijua njĂ« kalendar pĂ«r detyrat, CalDAV dhe abone ICS pĂ«r kalendare tĂ« jashtme;
  • JanĂ« zbatuar politikat e eskalimit tĂ« incidenteve me zinxhirĂ« tĂ« shumĂ«fishta pĂ«r ngritjen e nivelit;
  • Shtohen grupet e paralajmĂ«rimeve, grupimi i ngjarjeve, njoftimet e vonuara dhe bashkimi manual i alerteve tĂ« lidhura;
  • JanĂ« shtuar dritaret pĂ«r zhvillimin e punimeve tĂ« planifikuara dhe alerte 'tĂ« qeta';
  • Shtohet mundĂ«sia e shtimit tĂ« komenteve nĂ« alerte;
  • Shtohen prioritetet e incidenteve (P1-P5) dhe rritja automatike e prioritetit nĂ« pĂ«rputhje me nivelin e rĂ«ndĂ«sisĂ«;
  • JanĂ« realizuar katalogu i shĂ«rbimeve, varĂ«sitĂ« e shĂ«rbimeve, SLI/SLO, historia e ndikimit nĂ« funksionimin e sistemeve (Service Impact History) dhe shĂ«rbimet e biznesit (Business Services);
  • Shfaqet Explain Trace pĂ«r analizimin e rrugĂ«zimit: pse alerta arriti ose nuk arriti nĂ« ekip, u grupua, u shtyp ose u dĂ«rgua nĂ« njĂ« kanal tĂ« caktuar;
  • Shtohen kontrollet (Heartbeats/dead-man-switch) pĂ«r watchdog, backup, ETL dhe detyra tĂ« tjera, ku problemi Ă«shtĂ« mungesa e sinjalit tĂ« pritur.



Burimi: opennet.ru
Bleni hostim tĂ« besueshĂ«m pĂ«r faqe me mbrojtje nga DDoS, serverĂ« VPS VDS đŸ”„ Bleni hostim tĂ« besueshĂ«m pĂ«r faqe me mbrojtje nga DDoS, serverĂ« VPS VDS | ProHoster