La qualité du réseau sans fil est déjà intégrée par défaut dans le concept de niveau de service. Et si l'on souhaite répondre aux exigences élevées des clients, il faut non seulement traiter rapidement les problèmes de réseau qui surviennent, mais aussi prédire les problèmes les plus fréquents.
Comment y parvenir ? En surveillant ce qui est réellement important dans ce contexte : l'interaction de l'utilisateur avec le réseau sans fil.

Les charges sur les réseaux continuent d'augmenter, ce qui affecte particulièrement les segments sans fil, ne serait-ce que par la simplicité de leurs interfaces. Avec l'augmentation du nombre d'appareils et des vitesses de transmission de données, les problèmes se multiplient à plusieurs niveaux. Au niveau physique, de nombreux transmetteurs de signaux radio s'influencent mutuellement, même s'ils fonctionnent sur des parties adjacentes du spectre des fréquences. Au niveau logique, un grand nombre d'appareils connectés commencent à rivaliser pour le droit de commencer la transmission sur la fréquence choisie, augmentant le délai de livraison des paquets pour chaque utilisateur.
En même temps, les attentes de chaque client concernant l'utilisation du réseau sont également en hausse. Un chargement de page de 5 secondes dans le navigateur, qui semblait être un 'summum technologique' il y a 20 ans, ne surprend plus personne. Les clients veulent une vidéo HD sans interruption.
Les nouvelles versions des standards de transmission sans fil permettent de résoudre partiellement ce problème en utilisant plus efficacement le spectre des fréquences. Chaque vise à déployer des réseaux de plus en plus chargés. Cependant, dans un réseau à grande échelle où fonctionnent plusieurs dizaines de points d'accès, il ne sera pas possible de tout laisser à la charge du dernier standard (surtout lorsque les appareils fonctionnent en mode de compatibilité inversée dès qu'ils rencontrent un ancien appareil utilisateur). De même, il ne sera pas possible de continuer à vivre avec de vieux outils de surveillance - l'environnement réseau devient sans cesse plus complexe.
Pourquoi la surveillance classique ne fonctionne plus
Le stéréotype classique qui hante encore les administrateurs de tous les réseaux, y compris sans fil, est le travail uniquement en fonction des requêtes. Lorsque l'« alarme » se déclenche, nous nous réveillons et découvrons ce qui s'est mal passé. Et tant qu'il n'y a pas d'« alarme », nous pouvons nous contenter de vérifier la charge des composants principaux : les dispositifs réseau et utilisateurs.
Conformément à cette tâche, les outils de surveillance et de maintenance traditionnels fonctionnent sur la base de règles strictes et ne montrent pas toujours rapidement les problèmes existants, sans même parler d'une analyse prédictive.
Le principal problème ici réside dans l'intervalle de collecte des données. Les informations sur l'état des connexions réseau sans fil sont collectées toutes les minutes, et des incidents peuvent tout à fait se produire entre les collectes de données (un excellent exemple étant les pics de charge occasionnels qui "suspendent" le réseau). Sans données en temps réel, il est assez difficile de comprendre ce qui est à l'origine du problème. Est-ce un mauvais contrôle de la couverture réseau ? Ou peut-être des interférences externes sans rapport avec l'activité (par exemple, une base militaire à proximité a causé des perturbations dans l'air). Il n'y a pas de données pour voir la dégradation progressive de certaines caractéristiques du réseau, ce qui rend la localisation du problème d'autant plus difficile. Le personnel informatique devra consacrer des heures supplémentaires à la recherche de cette "aiguille dans une botte de foin".
En revanche, les utilisateurs finaux constatent le problème presque immédiatement. Une erreur de connexion, une interruption de diffusion vidéo – ce sont d'excellents indicateurs.
Les outils de surveillance classiques rapportent que des paquets réseau sont transmis. Mais ils ne peuvent en aucun cas répondre à la question de savoir si l'utilisateur a résolu son problème.
Pour obtenir une réponse à cette question, il ne suffira pas de changer simplement d'outil, mais également d'adopter une nouvelle approche à l'organisation de la surveillance. Il faut passer d'une gestion d'incidents basée sur des demandes (en réalité, un contrôle de la performance et de la charge de matériel spécifique) à un contrôle de l'expérience utilisateur et à l'identification de situations pouvant mener à des incidents.
Cette transformation implique la mise en œuvre d'algorithmes plus sophistiqués pour identifier les problèmes, au lieu de simples alertes lorsque certains seuils sont atteints. Dans la plateforme d'analyse réseau intelligente Huawei CampusInsight, ces algorithmes sont basés sur l'expérience du service des réseaux sans fil et sur des techniques d'apprentissage automatique.
Sous le capot de CampusInsight
Huawei CampusInsight – une plateforme de surveillance des réseaux sans fil évolutive, adaptée à diverses échelles. Conçue sur une architecture microservices, chaque service est déployé sur plusieurs instances, dont les communications sont gérées par un bus approprié. Des instances supplémentaires peuvent être déployées de manière dynamique pour augmenter la capacité de traitement de l'outil.
En pratique, CampusInsight collecte, analyse et affiche des données dans son interface utilisateur en cinq étapes.

La première et la deuxième étape consistent à accéder aux données (provenant des dispositifs générant ces données) et à recueillir des « mesures ». En utilisant la collecte de télémétrie en continu via le protocole GPB de Google et le Syslog « traditionnel » (là où c'est possible), Huawei CampusInsight accumule pratiquement en temps réel les données :
- sur l'utilisation du spectre de fréquences ;
- sur le fonctionnement des points d'accès et d'autres dispositifs réseau (indicateurs de performance, nombre d'utilisateurs connectés, etc.) ;
- sur le chemin des utilisateurs spécifiques – sur les profils réseau, concernant qui, quand et à quel point d'accès ils se sont connectés ou non (et avec quels paramètres de connexion) ;
- sur le fonctionnement des applications audio-vidéo (en utilisant eMDI, mis en œuvre dans l'un des paquets supplémentaires).
Pour contourner les limitations des outils traditionnels utilisant SNMP pour la collecte de données et le transfert de structures fixes, CampusInsight repose sur un modèle d'abonnement aux journaux nécessaires, ainsi que sur des algorithmes de codage et de décodage des données.
La troisième étape est la distribution et la mise en mémoire tampon – c'est-à-dire l'envoi de données « brutes » vers Kafka pour distribution à des services d'analyse de niveau supérieur.
La quatrième étape est l'analyse. Les algorithmes Big Data et IA aident à traiter rapidement les données « brutes ». En résultat, des problèmes spécifiques sont identifiés, liés à :
- l'authentification (le protocole Dot1x est pris en charge) et le fonctionnement de DHCP ;
- la stabilité et la vitesse de la connexion ;
- les interfaces sans fil ;
- le fonctionnement de dispositifs spécifiques, y compris des « détails » tels que des problèmes avec le PoE ou le passage d'un dispositif double bande à 2,4 GHz ;
- la qualité des flux audio-vidéo – cependant, cette fonction n'est supportée que pour le SIP non chiffré ou pour certains commutateurs ;
- le roaming entre différents points d'accès.
Les algorithmes d'IA sont utilisés pour résoudre certaines tâches spécifiques, comme la détection des interférences entre les canaux lors de la transmission sans fil.

Cinquième et dernière étape — sauvegarde des données dans la base de données distribuée en colonnes Druid pour une utilisation ultérieure.
L'analyse des informations collectées en tenant compte de la « ligne de base » construite sur ces mêmes données historiques permet d'identifier les types de « schémas d'échecs » — en déterminant les KPI correspondant aux situations problématiques et en localisant les problèmes, tout en proposant des solutions. Ainsi, environ 85% des problèmes réseau sont pris en compte.

Les données sont présentées à l'administrateur sous forme graphique selon la hiérarchie ou la topologie de l'espace (par exemple, le plan de bureau). Il est possible de créer des « cartes thermiques », d'analyser l'impact sur l'équipement de certaines plateformes ou fabricants, etc. Cela facilite la compréhension de la cause du problème.

Dans l'ensemble, CampusInsight offre de nombreux outils permettant de classifier les problèmes, de comparer les utilisateurs concernés, d'étudier les données de performance de clients spécifiques et même de « rejouer » les événements ayant précédé un incident pour identifier rapidement la source. Le produit prend également en charge le nouveau Wi-Fi 6, sans oublier les versions précédentes.
Cas d'utilisation
CampusInsight a déjà été testé dans la pratique, bien que la plupart des cas soient couverts par des NDA. Le cas le plus représentatif rendu public est l'utilisation de l'outil de surveillance dans son propre réseau sans fil Huawei.
Le réseau couvre des entreprises comptant environ 180 000 employés, dont 80 000 font partie du département R&D (bureau réparti dans plus de 170 pays, où un total de 62 000 points d'accès sont installés).
La mise en œuvre de CampusInsight a permis d'optimiser plus de 630 points d'accès, tout en améliorant l'efficacité de la gestion des incidents de 30%.
Ci-dessous, quelques situations concrètes.
Exemple 1. Panne collective
Les problèmes de haut niveau observés chez un grand nombre d'utilisateurs sont souvent le résultat d'erreurs de bas niveau. Identifier de tels problèmes n'est pas si simple. Par exemple, dans un des bureaux, de nombreux clients mobiles éprouvaient des difficultés d'authentification, malgré la validité des configurations et l'absence de problèmes. serveur L'authentification. La visualisation des données à différents niveaux a rapidement permis d'identifier que le problème venait d'un switch générant trop d'erreurs. Pour résoudre la situation, il a suffi de remplacer un morceau de câble. La localisation et la correction du problème ont pris 90 minutes.
Exemple 2. Suivi de la qualité du roaming
La collecte de données sur le parcours d'un client particulier au sein d'un réseau distribué permet de mettre en évidence des problèmes de roaming non apparents. Un cas courant est celui où des utilisateurs mobiles rencontrent des difficultés de connexion à des zones particulières d'un bâtiment (alors que, en apparence, le point d'accès correspondant fonctionne bien). L'une des sources de ces problèmes peut être une puissance de signal trop élevée du point d'accès dans la pièce voisine, ce qui amène le client à tenter de se connecter à un point d'accès qui, en ce moment, gère déjà de nombreux utilisateurs (cas réel : connexion au point d'accès dans la salle de conférence alors que l'utilisateur passe simplement à côté).
Pour résoudre le problème, il suffit parfois de réduire la puissance du signal du point d'accès surchargé, mais son identification nécessite une analyse approfondie des problèmes récurrents dans les pièces adjacentes à la salle de conférence.
En suivant les tendances du développement des réseaux sans fil, on peut s'attendre à ce que les problèmes de service ne touchent pas seulement les géants dont les réseaux comptent des milliers de points d'accès, mais aussi les PME, qui peuvent encore se contenter de travailler sur des incidents. En prévoyant un tel développement, il est logique d'observer de nouveaux standards plus efficaces et du matériel à haute performance. Mais il est également important de garder à l'esprit la nécessité de changer de paradigme en matière de service réseau, avant que les clients ne commencent une migration massive vers des concurrents en raison de la qualité du service.
Bien sûr, le produit sur site de la classe CampusInsight sera le plus bénéfique dans les déploiements à grande échelle, mais un abonnement cloud au service est déjà disponible à partir du cloud public local de Huawei, destiné à des déploiements dans le secteur des PME. En général, les intéressés peuvent tout essayer et le « tester » dès maintenant.
Source : habr.com
