Surveillance dans le data center : comment nous avons remplacé l'ancien BMS par un nouveau. Partie 3

Nous poursuivons notre récit sur comment nous avons changé le système BMS dans nos data centers (partie 1, partie 2). Tout en effectuant ce changement, nous n'avons pas simplement remplacé une solution d'un fournisseur par une autre, mais nous avons développé un système de zéro selon nos exigences. En conclusion de notre histoire, nous partageons les résultats de notre travail et les solutions intéressantes qui pourraient vous être utiles.

Nouvelle interface

Comme on dit, il vaut mieux voir une fois.

Surveillance dans le data center : comment nous avons remplacé l'ancien BMS par un nouveau. Partie 3Racks.

Analysons les différences.

  • Tout d'abord, c'est beau pratique. Remarquez combien il est devenu facile de suivre les charges sur les modules («Banks» ou simplement «Banques») PDU et la somme des charges parallèles des modules pairs. Sur le modèle de rack du nouveau BMS, nous voyons immédiatement que les modules inférieurs PDU sont surchargés (le courant total dépasse les 16A autorisés – «notification bleue»), tandis que les modules supérieurs sont sous-chargés. En cas de coupure d'une des entrées, toute la charge sera transférée sur la seconde, et le module inférieur restant sous tension sera désactivé à cause de la surcharge. Pour éviter cela, le service support du data center informera à l'avance le client et enverra des recommandations sur la manière de répartir la charge.
  • Ajout simple d'équipement. Dans le nouveau BMS, les capteurs virtuels de somme des courants des modules et de puissance du rack sont déjà ajoutés dans les modèles de racks standard et sont créés automatiquement après l'ajout au rack PDU. Dans l'ancien BMS, il fallait les créer manuellement, puis les faire glisser sur la carte, ce qui augmentait le risque d'erreur dû au «facteur humain».
  • Un espace illimité pour la créativité. Nous n'avons désormais plus de limitations lors de la création de capteurs virtuels. Il est possible de construire absolument n'importe quel modèle mathématique de n'importe quelle variable. Cela signifie que nous avons la possibilité de créer des capteurs virtuels complexes (auparavant, on ne pouvait que additionner les valeurs) et d'analyser mieux les statistiques et les tendances du fonctionnement des systèmes techniques. Cela améliore la qualité des décisions prises concernant la configuration des systèmes, le remplacement de l'équipement et la gestion des ressources. 
  • Interface compréhensible. Dans la nouvelle interface, il n'y a pas de surcharge d'icônes, les ventilateurs tournent, les interrupteurs « cliquent ». Et le plus pratique est la possibilité d'indiquer l'état PDU Line A/B à l'intérieur des armoires. Nous avons essayé de faire quelque chose de similaire dans l'ancienne BMS, mais le nombre d'icônes qui se chevauchent par centimètre carré de la carte nous a fait renoncer à cela.

Maintenant, il est agréable à regarder :

Surveillance dans le data center : comment nous avons remplacé l'ancien BMS par un nouveau. Partie 3
Serveurs.

Surveillance dans le data center : comment nous avons remplacé l'ancien BMS par un nouveau. Partie 3
Fragment de tableau électrique.

Surveillance dans le data center : comment nous avons remplacé l'ancien BMS par un nouveau. Partie 3
Panneau de contrôle de la ventilation.

Et en plus, la nouvelle BMS peut être décorée pour le Nouvel An 🙂
Surveillance dans le data center : comment nous avons remplacé l'ancien BMS par un nouveau. Partie 3

One page – compréhension mutuelle en un mot et sans cahier des charges

Nous avons très longtemps voulu réaliser une autre « fonctionnalité » dans la BMS : regrouper sur une seule page les principaux paramètres du datacenter, de sorte qu'un seul coup d'œil à l'écran soit suffisant pour évaluer l'état des systèmes principaux. Cependant, nous ne savions pas exactement à quoi cela devrait ressembler.

Avant même de commencer le développement de la nouvelle BMS, nous avons visité une dizaine de datacenters aux Pays-Bas. Un des objectifs était de voir des exemples de mise en œuvre de cette page.

Et dans aucun des datacenters, nous ne l'avons vue - dans certains, elle n'était pas présente, dans d'autres, elle était « en cours de développement », et ailleurs c'était « un grand secret commercial ». Par conséquent, dans notre cahier des charges pour la création de la nouvelle BMS, la description précise de cette page, qui est très importante pour nous, était absente.

Finalement, nous l'avons imaginée littéralement « sur le pouce ». À ce moment-là, il fallait conseiller à distance des collègues dans le datacenter. Feuilleter les pages de la BMS sur le téléphone à la recherche de données éparpillées était très inconfortable, et en fait, la première version a été ébauchée sur une serviette. One page. Elle a été réalisée par les développeurs à partir des photos. 

Suivant l'exemple de nos prudents collègues néerlandais, nous ne montrerons pas la version finale de notre page principale, d'autant plus que chaque datacenter est unique et qu'il n'y a pas de sens à la copier. Mais nous allons décrire deux principes clés de sa formation :

  1. C'est un tableau conçu pour le format d'écran vertical des smartphones (ou des moniteurs, en conservant l'orientation verticale), affichant toutes les informations importantes sur un seul écran. Au-dessus du tableau, un « résumé » des incidents actifs est fourni, il est donc plus pratique de les placer tous ensemble dans un format vertical. 
  2. La disposition des cellules dans le tableau imite l'architecture du Data Center (physique ou logique). Nous avons abandonné le classement des systèmes par ordre alphabétique, comme cela semble évident au premier abord. L'ordre reflète les associations visuelles du personnel du data center – comme s'ils surveillaient physiquement toutes les salles et systèmes. Cela facilite la recherche d'informations.

En réalité, désormais, toutes les caractéristiques clés du Data Center sont regroupées et présentées sur un seul écran de smartphone / moniteur de l'ingénieur responsable et du dirigeant, tout en étant liées à la topographie physique et logique du Data Center. 

Voici une photo de ce premier brouillon, bien sûr, cette version a ensuite été repensée et améliorée.

Surveillance dans le data center : comment nous avons remplacé l'ancien BMS par un nouveau. Partie 3

Confirmation et synthèse des incidents

Nous allons parler d'un nouveau concept qui a émergé dans le cadre du projet de mise à jour du système de surveillance.

La confirmation est un terme assez rare proposé par le développeur du nouveau BMS. Il signifie la confirmation que l'opérateur a vu l'incident, l'a reconnu et a accepté la responsabilité de le résoudre.  

Le terme a pris racine, et maintenant nous "confirmons" les incidents.

L'algorithme de la version de base du nouveau BMS ne nous a pas satisfait. En fait, il s'agissait de commentaires dans le journal des événements, c'est-à-dire que les incidents résolus ne disparaissaient pas du journal, et ceux acceptés ("confirmés") n'étaient pas triés des nouveaux.

En fin de compte, une fenêtre appelée "synthèse" a été développée, dans laquelle :

  1. Seuls les incidents actifs et les dispositifs en mode service sont affichés (sans notifications commerciales « bleues »).
  2. Les incidents NOUVEAUX et ACCEPTÉS sont clairement séparés.
  3. Il est indiqué qui a accepté l'incident.

L'algorithme de travail des agents de garde dans le nouveau BMS est le suivant :

  1. Les nouveaux incidents apparaissent dans la synthèse et attendent d'être confirmés. Ils ne peuvent pas rester longtemps dans cette section, le responsable de l'équipement doit immédiatement prendre l'incident en charge.
  2. L'employé prend l'incident en charge en cliquant sur la coche à droite. Comme chaque employé possède un identifiant unique, il est automatiquement affiché qui a pris l'incident. Si nécessaire, un commentaire peut être laissé.
  3. L'incident est déplacé dans la section « Accusés de réception », les autres agents de service et le responsable comprennent que l'incident est pris en charge par le collaborateur responsable.

Surveillance dans le data center : comment nous avons remplacé l'ancien BMS par un nouveau. Partie 3
Exemple de fenêtre de résumé avec un nouveau message et un message déjà accusé de réception.

En reliant la fenêtre de résumé à la table One page, nous avons obtenu un véritable écran principal du système BMS, où l'on peut immédiatement voir : 

  • l'état des principaux systèmes du centre de données ;
  • la présence de nouveaux incidents non traités ;
  • la présence d'incidents acceptés et les données sur qui s'en occupe précisément.

Accès via le navigateur et notifications contextuelles sur le téléphone

L'interface web, accessible depuis n'importe quel appareil de n'importe où dans le monde, contraste fortement avec le client « lourd », totalement fermé aux utilisateurs externes. 

L'ancienne approche entraînait un ensemble d'inconvénients, allant des problèmes d'organisation du travail à distance des employés du service de surveillance à la nécessité d'installer des clients « lourds » à partir de distribs sur les postes de travail du personnel dans le centre de données.

Désormais, chaque page dans BMS a une adresse unique, ce qui permet de partager non seulement l'adresse directe de la page ou de l'appareil, mais également des liens vers des graphiques/rapports uniques. 

L'accès au système se fait désormais par authentification LDAP via Active Directory, ce qui renforce son niveau de sécurité. 

La mobilité est aujourd'hui un facteur clé pour le bon travail des ingénieurs de service. En plus de contrôler la surveillance dans la salle de garde, les ingénieurs effectuent des rondes, accomplissent des tâches en dehors de la « salle de garde » et, grâce à l'écran principal de BMS optimisé pour les mobiles, ne perdent pas le contrôle de ce qui se passe dans les salles machines une seconde. 

La qualité du contrôle s'améliore également grâce aux fonctionnalités des chats de travail. Ils accélèrent les processus en permettant de « lier » la correspondance des ingénieurs de service à BMS. Nous, par exemple, utilisons l'application Teams, qui permet de mener des conversations internes et de recevoir sur le téléphone tous les messages de BMS sous forme de notifications Push contextuelles, ce qui soulage l'agent de service de l'obligation de regarder constamment l'écran du téléphone.

Surveillance dans le data center : comment nous avons remplacé l'ancien BMS par un nouveau. Partie 3
 Notification Push sur l'écran du smartphone.

Surveillance dans le data center : comment nous avons remplacé l'ancien BMS par un nouveau. Partie 3
Voici à quoi ressemblent les notifications dans l'application Teams.

Les notifications contextuelles sont désormais configurées uniquement pour les messages concernant l'apparition d'incidents, minimisant ainsi les distractions. Le personnel sait que si une notification Push Teams apparaît sur l'écran de leur smartphone, il doit se rendre sur la page BMS et accepter l'incident. Les messages relatifs à la résolution des incidents sont suivis directement sur la page BMS.

Surveillance dans le data center : comment nous avons remplacé l'ancien BMS par un nouveau. Partie 3
Voici une capture d'écran de l'interface BMS sur un smartphone.

En résumé

Avec le coût de mise à jour de la BMS chez notre ancien fournisseur, comparable au développement d'un nouveau système de zéro (environ 100 000 $), la différence de fonctionnalités entre les produits s'est révélée colossale. Nous avons obtenu un système flexible, optimisé pour nos tâches et processus commerciaux. Nous avons également réalisé des économies substantielles dans les coûts courants de support et de mise à jour du système. 

Mais, bien sûr, il y a eu des difficultés. 

  • Tout d'abord, nous avons sous-estimé l'ampleur des modifications nécessaires à apporter à la version de base de la nouvelle BMS et nous n'avons pas respecté les délais préalablement convenus. Ce n'était pas un problème critique pour nous, car nous avons toujours travaillé avec l'ancienne version et le processus était créatif, complexe, et a donc parfois pris plus de temps que prévu. De plus, nous avons toujours vu que notre développeur déployait un maximum d'efforts pour atteindre le meilleur résultat. Mais en réalité, l'histoire a été très longue, et nos spécialistes clés y ont consacré beaucoup plus d'efforts et de temps que prévu. 
  • Deuxièmement, il a fallu plusieurs phases de tests pour peaufiner l'algorithme de réservation des machines virtuelles et des canaux de communication. Au départ, il y avait des pannes tant du côté du système BMS que du côté des machines virtuelles et du réseau. Cette mise au point a également pris du temps. Heureusement, le contractant a bénéficié d'une plateforme de test sous forme de service cloud où tous les paramètres et innovations étaient testés à l'origine.
  • Troisièmement, le système final s'est avéré plus complexe à modifier pour l'utilisateur final. Alors qu'auparavant, la carte était un fond (un fichier graphique) avec des icônes faciles à changer ou à déplacer, c'est maintenant une interface graphique complexe avec des animations, nécessitant des compétences particulières pour la modification.

La mise à jour radicale de notre système BMS peut déjà être considérée comme le projet le plus important de l'année dernière, qui aura un impact significatif sur la qualité de la gestion opérationnelle de nos installations à l'avenir. 

Nous n'avons bien sûr pas jeté l'ancien serveur, mais l'avons "allégé" : nous avons supprimé des milliers de capteurs et de PDU « commerciaux » et n'avons conservé que quelques dizaines d'appareils essentiels, tels que les groupes électrogènes, les onduleurs, les climatiseurs, les pompes, les capteurs de fuite et de température. Dans ce mode, il a retrouvé sa vitesse d'antan et peut servir de "réserve de réserve". Au fait, après avoir supprimé le PDU de l'ancien BMS, nous avons libéré près de 1000 licences désormais inutiles, par hasard, vous ne sauriez pas quoi en faire ?

Source : habr.com

Acheter un hébergement fiable pour les sites avec protection DDoS, serveurs VPS VDS 🔥 Acheter un hébergement fiable pour les sites avec protection DDoS, serveurs VPS VDS | ProHoster