Grafana Labs, mis arendab andmete visualiseerimise platvormi Grafana ja jälgimissüsteemi Prometheus, kuulutas välja OnCall'i sündmuste reageerimise süsteemi lähtekoodi, mis on mõeldud meeskondade koostöö toetamiseks sündmuste lahendamisel ja analüüsil. OnCall, mis varem pakkus suletud tootena, omandati Grafana poolt ettevõtte Amixr Inc. ülevõtmise käigus eelmisel aastal. Projekti kood on kirjutatud Pythonis ja see on avatud AGPLv3 litsentsi all.
Süsteem võimaldab koguda teavet anomaaliate ja sündmuste kohta eri jälgimissüsteemidest, seejärel rühmitatakse andmed automaatselt, suunatakse teated vastutavatele gruppidele ja jälgitakse probleemide lahendamise staatust. Toetatakse integratsiooni jälgimissüsteemidega Grafana, Prometheus, AlertManager ja Zabbix. Jälgimissüsteemidelt saadud teabest filtreeritakse välja teisejärgulised ja väheolulised sündmused, dubleerivad andmed kogutakse ning välistatakse probleemid, mida saab lahendada ilma inimsekkumiseta.
Olulised sündmused, mis on vabanenud liigsetest infomüra, jõuavad teavitussüsteemi, mis määrab töötajad, kes vastutavad tuvastatud probleemikategooriate lahendamise eest, ja saadab teadlikkused, arvestades nende tööaegade ja tegevuse taset (kavandaja kalendri andmed). Toetatakse probleemide sidumise rotatsiooni erinevate töötajate vahel ning kriitiliste või lahendamata probleemide eskaleerimist teiste meeskonna liikmete või kõrgemate töötajate juurde.

Olenevalt juhtumi olulisusest võivad teavitusi saata telefonikõned, SMSid, e-kiri, kalendriürituste loomine, messengrid Slack ja Telegram. Samuti võivad Slackis automaatselt luua kanaleid, et arutada juhtumi lahendamisega seotud küsimusi, kuhu liituvad automaatselt nii üksik töötajad kui ka tervikud.
Süsteem pakub paindlikke laiendamise ja kohandamise võimalusi (näiteks saab seadistada sündmuste rühmitamist ja marsruutimist, määrata teavitamise reeglid ja kanalid). Väliste süsteemidega integreerimiseks on saadaval API ja Terraformi tugi. Töö juhtimine toimub läbi veebiliidese.

Allikas: opennet.ru
