بعد خمسة أشهر من التطوير، تم إطلاق IncidentRelay 1.1. وهو نظام مفتوح المصدر لإدارة المناوبات، وتوجيه التنبيهات، والاستجابة للحوادث، ويعمل على خادم مُستضاف ذاتيًا. يُعد IncidentRelay 1.1 أول إصدار مستقر (بينما كان الإصدار 1.0 في مرحلة تجريبية). يستهدف المشروع مهندسي موثوقية الموقع (SREs)، وفرق DevOps، وفرق البنية التحتية التي تبحث عن بديل محلي لخدمات SaaS لإدارة المناوبات، وسياسات التصعيد، والاستجابة للحوادث. كُتب كود المشروع بلغة بايثون، ويُوزع بموجب ترخيص MIT.
يستقبل نظام IncidentRelay الأحداث من أنظمة المراقبة، ويربطها بالخدمة والفريق ونظام المناوبة، ثم يرسل إشعارات إلى ضباط أو فرق العمل المسؤولين. ويتولى النظام تنفيذ جداول المناوبة، والمناوبات، وتجاوزات الورديات، وتأكيد الحوادث، وحالة التأكيد/الحل، والتذكيرات، والتصعيد، واستبدال ضباط العمل المؤقتين، وأوقات الصيانة المجدولة، وحجب التنبيهات.
تتمثل الميزة الرئيسية للمشروع في التحكم الكامل في البنية التحتية ومنطق التوجيه. يتم نشر IncidentRelay في بيئة خاصة به، ويعمل بقاعدة بيانات خاصة به، ويتيح فصلًا واضحًا بين المسارات والأوامر والتناوب وقنوات التسليم الواردة. تنتمي الرموز المميزة الواردة إلى المسارات، وليس إلى القنوات، مما يُسهّل فهم أي مصدر خارجي لديه إذن بإرسال الأحداث إلى أمر معين.
يدعم IncidentRelay استقبال الأحداث من Prometheus Alertmanager وGrafana Alerting وZabbix وSentry وLibreNMS وRMON وAWS SNS/CloudWatch، بالإضافة إلى روابط الويب المخصصة. ويمكن إرسال الإشعارات عبر Mattermost وSlack وTelegram وDiscord وMicrosoft Teams والبريد الإلكتروني وروابط الويب وإشعارات المتصفح/تطبيقات الويب التقدمية ومزودي المكالمات الصوتية. في Mattermost وTelegram، يمكن أن تتضمن الإشعارات إجراءات للتأكيد على المشكلة وحلها، مما يسمح بمعالجة الحوادث دون الحاجة إلى الانتقال إلى واجهة منفصلة.
يمكن تشغيل المشروع عبر Docker Compose، وهي حزمة RPM لتوزيعات Red Hat، أو يدويًا عبر systemd، أو في Kubernetes باستخدام مخطط Helm. يُنصح باستخدام SQLite للتركيبات الصغيرة، بينما يُوصى باستخدام PostgreSQL لبيئات الإنتاج والأحمال العالية.
يقترح الإصدار الجديد التغييرات التالية:
- تمت إضافة نظام مناوبات متعدد المستويات مع حدود زمنية وأولويات للطبقات، مع مراعاة البدائل المؤقتة؛
- ظهرت تقويمات العمل، واشتراكات CalDAV وICS للتقاويم الخارجية؛
- تم تطبيق سياسات تصعيد الحوادث باستخدام سلاسل تصعيد متعددة الخطوات؛
- تمت إضافة مجموعات التنبيهات، وتجميع الأحداث، والإشعارات المتأخرة، والدمج اليدوي للتنبيهات ذات الصلة؛
- ظهرت نوافذ للعمل المجدول والتنبيهات "الصامتة"؛
- تمت إضافة إمكانية إضافة تعليقات إلى التنبيهات؛
- تمت إضافة أولويات الحوادث (P1-P5) والتصعيد التلقائي للأولويات بناءً على مستوى الأهمية؛
- تم تنفيذ كتالوج الخدمات، وتبعيات الخدمات، ومؤشر مستوى الخدمة/التزام مستوى الخدمة، وسجل تأثير الخدمة، وخدمات الأعمال؛
- تمت إضافة خاصية شرح التتبع لتحليل التوجيه: لماذا تم تضمين تنبيه أو عدم تضمينه في أمر ما، أو تم تجميعه، أو كبته، أو إرساله إلى قناة معينة؛
- تمت إضافة عمليات فحص (نبضات القلب/مفتاح الرجل الميت) لمراقبة النظام، والنسخ الاحتياطي، و ETL، والمهام الأخرى التي تكون فيها المشكلة هي غياب الإشارة المتوقعة.


المصدر: opennet.ru
