
Comment mettre à jour les équipements réseau dans une grande entreprise sans arrêter la production? Le projet à grande échelle en mode « opération à cœur ouvert » est présenté par le chef de projet de Linxdatacenter, Oleg Fedorov.
Au cours des dernières années, nous avons constaté une demande accrue des clients pour des services liés à la composante réseau de l'infrastructure informatique. Le besoin de connectivité des systèmes informatiques, des services, des applications, ainsi que les tâches de surveillance et de gestion opérationnelle des affaires, dans pratiquement tous les secteurs, obligent aujourd'hui les entreprises à accorder une attention particulière aux réseaux.
La gamme des demandes varie de l'assurance de la redondance du réseau à la création et à la gestion d'un système autonome pour le client, avec l'acquisition d'un bloc adresses IP, la configuration des protocoles de routage et la gestion du trafic conformément aux politiques des organisations.
La demande pour des solutions intégrées de construction et de maintenance des infrastructures réseau augmente également, tout particulièrement de la part des clients dont l'infrastructure réseau est créée à partir de zéro ou est obsolète, nécessitant des modifications majeures.
Cette tendance coïncide avec une période de développement et de complexification de notre propre infrastructure réseau chez Linxdatacenter. Nous avons élargi notre présence géographique en Europe grâce à des connexions à des sites distants, ce qui a également nécessité l'amélioration de notre infrastructure réseau.
L'entreprise a lancé un nouveau service pour les clients, le Network-as-a-Service : nous prenons en charge toutes les tâches réseau de nos clients, leur permettant de se concentrer sur leur cœur de métier.
À l'été 2020, le premier grand projet dans cette direction a été achevé, et nous aimerions en parler.
Au départ
Un grand complexe industriel s'est tourné vers nous pour moderniser la partie réseau de l'infrastructure de l'un de ses sites. Il était nécessaire de remplacer les anciens équipements par des nouveaux, y compris le noyau du réseau.
La dernière mise à niveau de l'équipement sur le site avait eu lieu il y a environ 10 ans. La nouvelle direction a décidé d'améliorer la connectivité en commençant par la mise à jour de l'infrastructure au niveau le plus fondamental, physique.
Le projet a été divisé en deux parties : la mise à niveau du parc serveur et des équipements réseau. Nous étions responsables de la deuxième partie.
Les exigences de base pour les travaux comprenaient la minimisation des temps d'arrêt des lignes de production de l'entreprise lors de l'exécution des travaux (et dans certaines zones, l'élimination totale des temps d'arrêt). Tout arrêt représente une perte de revenus directe pour le client, ce qui ne devait pas se produire sous aucune circonstance. Compte tenu du mode de fonctionnement de l'installation 24h/24, 7j/7, 365 jours par an, ainsi que de l'absence totale de périodes de temps d'arrêt planifiés dans la pratique de l'entreprise, on nous a assigné la tâche, en réalité, de réaliser une opération à cœur ouvert. Cela a été la principale caractéristique du projet.
Allons-y
Les travaux étaient planifiés selon le principe de déplacement des nœuds du réseau éloignés du noyau vers ceux plus proches, ainsi que des nœuds ayant moins d'impact sur les lignes de production vers ceux ayant un impact direct sur leur fonctionnement.
Par exemple, en prenant un nœud du réseau dans le département des ventes, une interruption de la communication en raison des travaux dans ce département n'affecterait en aucun cas la production. En même temps, un tel incident nous aidera, en tant qu'entrepreneur, à vérifier l'exactitude de l'approche choisie pour le travail sur ces nœuds et, en ajustant nos actions, à travailler sur les étapes suivantes du projet.
Il est nécessaire non seulement de remplacer les nœuds et les câbles du réseau, mais aussi de bien configurer tous les composants pour assurer le bon fonctionnement de la solution dans son ensemble. C'est précisément les configurations qui ont été vérifiées de cette manière : en commençant les travaux à distance du noyau, nous nous donnions en quelque sorte "le droit à l'erreur", sans compromettre les zones critiques pour le fonctionnement de l'entreprise.
Nous avons identifié des zones n'impactant pas le processus de production, ainsi que des zones critiques - ateliers, bloc de chargement et déchargement, entrepôts, etc. Pour les zones clés, un temps d'arrêt acceptable a été convenu avec le client pour chaque nœud du réseau séparément : de 1 à 15 minutes. Il était impossible d'éviter complètement la déconnexion de certains nœuds du réseau, car le câble doit être physiquement déplacé de l'ancien équipement vers le nouveau, et lors de ce changement, il est également nécessaire de défaire le "bourrage" de câbles qui s'est formé au cours de plusieurs années d'exploitation sans soins appropriés (l'une des conséquences de l'externalisation des travaux de montage des lignes de câble).
Les travaux ont été divisés en plusieurs étapes.
Étape 1 – Audit. Préparation et accord sur l'approche de planification des travaux et évaluation de la readiness des équipes : le client, le contractant responsable de l'installation et notre équipe.
Étape 2 – Élaboration du format pour la réalisation des travaux, avec une analyse approfondie et une planification détaillée. Nous avons choisi un format de check-list indiquant exactement l'ordre et la séquence des actions, jusqu'à l'ordre de commutation des patch-cords par ports.
Étape 3 – Réalisation des travaux dans les armoires, n'impactant pas la production. Évaluation et ajustement du temps d'arrêt pour les étapes de travail suivantes.
Étape 4 – Réalisation des travaux dans les armoires, influençant directement la production. Évaluation et ajustement du temps d'arrêt pour l'étape finale des travaux.
Étape 5 – Réalisation des travaux dans la salle des serveurs pour la commutation du matériel restant. Lancement de la routage sur le nouveau cœur.
Étape 6 – Commutation séquentielle du cœur du système des anciennes configurations réseau aux nouvelles pour un passage fluide de l'ensemble du système (VLAN, routage, etc.). À cette étape, nous avons connecté tous les utilisateurs et transféré tous les services vers le nouveau matériel, vérifié la justesse de la connexion, assuré qu'aucun des services de l'entreprise ne se soit arrêté, garanti qu'en cas de problème, ceux-ci seraient directement liés au cœur, facilitant ainsi le dépannage et la configuration finale.
Coiffure des câbles
Le projet s'est avéré complexe en raison des conditions initiales difficiles.
Tout d'abord, il y a un énorme nombre de nœuds et de segments de réseau, avec une topologie compliquée et une classification des câbles selon leur destination. Ces 'coiffures' devaient être extraites des armoires et soigneusement 'coiffées', en déterminant quel câble venais d'où et où il menait.
Cela ressemblait à peu près à ceci :

donc :

ou ainsi :

Deuxièmement, pour chaque tâche de ce type, il était nécessaire de préparer un fichier décrivant le processus. «Prenez le câble X du port 1 de l'ancien équipement, branchez-le dans le port 18 du nouvel équipement». Cela semble simple, mais lorsque vous avez 48 ports complètement remplis dans les données d'origine, et qu'il n'y a pas d'option d'arrêt (nous nous souvenons du 24x7x365), la seule solution est de travailler par blocs. Plus vous pouvez retirer de câbles de l'ancien équipement en une seule fois, plus vous pourrez les organiser et les insérer dans le nouveau «matériel» réseau, évitant ainsi des pannes et des temps d'arrêt dans le fonctionnement du réseau.
C'est pourquoi, lors de la phase préparatoire, nous avons segmenté le réseau par blocs - chacun d'eux étant associé à un VLAN spécifique. Chaque port (ou son sous-ensemble) sur l'ancien équipement correspond à un VLAN dans la nouvelle topologie du réseau. Nous les avons regroupés de cette façon : dans les premiers ports du commutateur se trouvent les réseaux utilisateurs, au milieu les réseaux de production, et dans les derniers, les points d'accès et les uplinks.
Cette approche a permis de retirer et d'organiser 10 à 15 câbles de l'ancien équipement en une seule fois, au lieu d'un seul. Cela a considérablement accéléré le processus de travail.
Au fait, voici à quoi ressemblent les câbles dans les racks après organisation :

ou, par exemple, comme ça :

Après avoir terminé la deuxième étape, nous avons pris une pause pour analyser les erreurs et la dynamique du projet. Par exemple, des petites imprécisions sont immédiatement apparues en raison d'inexactitudes dans les schémas de réseau qui nous avaient été fournis (connecteur incorrect sur le schéma - cordon de raccordement acheté incorrect et nécessité de le remplacer).
La pause était nécessaire, car lorsqu'on travaille avec des serveurs, le moindre aléa dans le processus était inacceptable. Si l'objectif est de garantir un temps d'arrêt sur une section du réseau de pas plus de 5 minutes, alors il ne fallait pas le dépasser. Toute déviation possible par rapport au calendrier devait être approuvée par le client.
Cependant, la planification préalable et la segmentation du projet en blocs ont permis de respecter le temps d'arrêt prévu sur toutes les sections, et dans la plupart des cas, de s'en passer complètement.
Défi du temps - projet sous COVID
Cependant, il y a eu des complications supplémentaires. Bien sûr, l'une des obstacles a été le coronavirus.
Les travaux ont été compliqués par le fait qu'une pandémie a commencé, rendant impossible la présence de tous les spécialistes impliqués sur le site du client. Seuls les employés de l'organisation de montage ont été autorisés sur le site, et le contrôle a été effectué via une salle Zoom – y étaient présents l'ingénieur réseau de Linxdatacenter, moi en tant que chef de projet, l'ingénieur réseau du client, responsable de la production des travaux, et l'équipe effectuant les travaux de montage.
Au cours des travaux, des problèmes imprévus sont survenus, nécessitant des ajustements en temps réel. Cela a permis de prévenir rapidement l'impact du facteur humain (erreurs dans le schéma, erreurs dans la détermination de l'état d'activité de l'interface, etc.).
Bien que le format de travail à distance ait semblé inhabituel au début du projet, nous nous sommes assez rapidement adaptés aux nouvelles conditions et avons atteint la phase finale des travaux.
Nous avons lancé une configuration temporaire des paramètres réseau pour le fonctionnement parallèle de deux noyaux réseau – ancien et nouveau – afin d'assurer une transition en douceur. Cependant, il s'est avéré qu'une ligne superflue n'avait pas été supprimée du fichier de configuration du nouveau noyau, ce qui a empêché la transition. Cela nous a fait perdre un certain temps à chercher le problème.
Il s'est avéré que le trafic principal était transmis correctement, alors que le trafic de gestion n'atteignait pas le nœud via le nouveau noyau. Grâce à une séparation claire du projet en étapes, nous avons pu rapidement identifier la zone du réseau où se trouvait la difficulté, cerner le problème et le résoudre.
En conséquence
Résultats techniques du projet
Tout d'abord, un nouveau noyau du nouveau réseau d'entreprise a été créé, pour lequel nous avons construit des anneaux physiques/logiques. Cela a été fait de manière à ce que chaque commutateur dans le réseau ait un « second bras ». Dans l'ancien réseau, de nombreux commutateurs étaient connectés au noyau par un seul chemin, par un seul bras (uplink). Si ce dernier se coupait, le commutateur devenait complètement inaccessible. De plus, si plusieurs commutateurs étaient connectés via un seul uplink, une panne entraînait l'arrêt complet d'un département ou d'une ligne de production dans l'entreprise.
Dans le nouveau réseau, même un incident réseau assez sérieux ne pourra jamais « tomber » tout le réseau ou une partie significative de celui-ci.
90 % de tout le matériel réseau a été mis à jour, les convertisseurs médias ont été retirés de l'exploitation, et il n'est plus nécessaire d'avoir des lignes d'alimentation dédiées pour alimenter l'équipement via les commutateurs PoE, où l'alimentation est fournie par les câbles Ethernet.
De plus, toutes les connexions optiques dans la salle des serveurs et dans les armoires sur site ont été marquées - sur tous les nœuds clés de communication. Cela a permis de préparer un schéma topologique de l'équipement et des connexions dans le réseau, reflétant son état réel aujourd'hui.
Schéma du réseau

Le principal résultat sur le plan technique : des travaux d'infrastructure suffisamment vastes ont été réalisés rapidement, sans perturber le fonctionnement de l'entreprise et pratiquement sans que son personnel ne s'en aperçoive.
Résultats commerciaux du projet
À mon avis, ce projet est intéressant avant tout non pas du point de vue technique, mais du point de vue organisationnel. La complexité résidait avant tout dans la planification et la réflexion des étapes de mise en œuvre des tâches du projet.
Le succès du projet permet d'affirmer que notre initiative de développement du secteur réseau au sein du portefeuille de services de Linxdatacenter est un choix stratégique pertinent pour le développement de l'entreprise. Une approche responsable de la gestion de projet, une stratégie réfléchie et une planification claire nous ont permis d'achever le travail à un niveau satisfaisant.
La confirmation de la qualité du travail - une demande du client pour continuer à fournir des services de modernisation du réseau sur ses autres sites en Russie.
Source : habr.com
