La calidad de la red inalámbrica ya forma parte del concepto de nivel de servicio. Y si se desea satisfacer las altas exigencias de los clientes, no solo es necesario actuar rápidamente ante los problemas de red que surgen, sino también predecir los que son más comunes.
¿Cómo lograrlo? Solo rastreando lo que realmente importa en este contexto: la interacción del usuario con la red inalámbrica.

Las cargas en las redes siguen creciendo, y esto afecta especialmente a los segmentos inalámbricos, al menos debido a la apertura de sus interfaces. Con el aumento del número de dispositivos y las velocidades de transferencia de datos, los problemas se multiplican en varios niveles. A nivel físico, muchos transmisores de señal de radio se afectan mutuamente, incluso si operan en secciones adyacentes del espectro de frecuencias. A nivel lógico, un gran número de dispositivos conectados comienzan a competir por el derecho a iniciar la transmisión en la frecuencia seleccionada, aumentando la latencia en la entrega de paquetes para cada usuario.
Al mismo tiempo, las expectativas de cada cliente respecto al uso de la red también aumentan. Una carga de página en el navegador de 5 segundos, que hace unos 20 años parecía 'la cima de la tecnología', ya no sorprende a nadie. Los clientes demandan videoconferencias en HD sin interrupciones en la imagen.
Las nuevas versiones de los estándares de transmisión inalámbrica ayudan a abordar parcialmente el problema, utilizando de manera más eficiente el espectro de frecuencias. Cada está diseñada para implementar redes cada vez más sobrecargadas. Pero en una red a gran escala, donde operan no solo unas pocas decenas de puntos de acceso, ya no es posible dejar todo a merced de un nuevo estándar (especialmente porque los dispositivos operan en modo de compatibilidad con versiones anteriores tan pronto como encuentran un dispositivo de usuario antiguo). Tampoco es viable seguir utilizando antiguos métodos de monitoreo: el entorno de red se vuelve cada vez más complejo.
Por qué la monitorización convencional ya no funciona
El clásico estereotipo que todavía persigue a los administradores de todas las redes, incluidas las inalámbricas, es trabajar únicamente bajo demanda. Suena la 'alarm' — despertamos y averiguamos qué salió mal. Y mientras no haya 'alarm', se puede limitar a comprobar la carga en los componentes principales: dispositivos de red y de usuario.
De acuerdo con esta tarea, las herramientas tradicionales de monitoreo y mantenimiento funcionan bajo principios rígidos y no siempre muestran de manera oportuna los problemas ya existentes, sin mencionar ningún tipo de análisis predictivo.
El principal problema aquí radica en el intervalo de recolección de datos. La información sobre el estado de las conexiones de red inalámbrica se recopila cada pocos minutos, y los incidentes pueden ocurrir entre las recolecciones (un gran ejemplo son los picos de carga raros que 'congelan' la red). Sin datos en tiempo real, es bastante difícil entender cuál fue la causa fundamental del problema. ¿Es un mal manejo de la cobertura de red? ¿O, tal vez, interferencias externas no relacionadas con el negocio (por ejemplo, una unidad militar cercana 'interfiriendo' en la señal)? No hay datos que permitan observar la degradación gradual de ciertas características de la red, y por lo tanto localizar el problema no es tan sencillo. El personal de TI tendrá que gastar horas adicionales buscando esa 'aguja en un pajar'.
Sin embargo, los usuarios finales notan el problema casi de inmediato. Errores de conexión, interrupciones en la transmisión de video son excelentes indicadores.
Las herramientas de monitoreo clásicas informan que los paquetes de red están fluyendo. Pero no pueden responder a la pregunta de si el usuario ha resuelto su tarea.
Para obtener una respuesta a esta pregunta, será necesario cambiar no solo la herramienta, sino también el enfoque para organizar el monitoreo. De la labor 'extintora' por solicitudes (de hecho, controlando el rendimiento y la carga de hardware específico) a centrarse en la experiencia del usuario y en identificar situaciones que puedan llevar a incidentes.
Esta transformación implica la implementación de algoritmos más complejos para detectar problemas, en lugar de simples alertas al alcanzar ciertos valores. En la plataforma de análisis de red inteligente Huawei CampusInsight, estos algoritmos se basan en la experiencia de servicio de redes inalámbricas y en técnicas de autoaprendizaje.
Bajo el capó de CampusInsight
Huawei CampusInsight: una plataforma escalable para el monitoreo de redes inalámbricas de diversas magnitudes. Construida sobre una arquitectura de microservicios. Cada servicio se despliega en múltiples instancias, cuyos mensajes son distribuidos por el bus correspondiente. Se pueden desplegar instancias adicionales de forma dinámica, aumentando la capacidad del instrumento.
De hecho, CampusInsight recopila, analiza y muestra datos en su interfaz de usuario en cinco pasos.

El primer y segundo paso son el acceso a los datos (a los dispositivos que los generan) y la recopilación de 'lecturas'. Utilizando la recolección de telemetría en tiempo real mediante el protocolo GPB de Google y Syslog 'tradicional' (donde sea posible), Huawei CampusInsight acumula datos prácticamente en tiempo real:
- sobre la utilización del espectro de frecuencias;
- sobre el funcionamiento de los puntos de acceso y otros dispositivos de red (indicadores de rendimiento, número de usuarios conectados, etc.);
- sobre el camino de usuarios específicos: sobre los perfiles de red, quién, cuándo y a qué punto de acceso se conectó o no (y con qué parámetros de conexión);
- sobre el funcionamiento de aplicaciones de audio y video (utilizando eMDI, implementada en uno de los paquetes adicionales).
Para sortear las limitaciones de las herramientas tradicionales que utilizan SNMP para la recopilación de datos y el envío de estructuras fijas, CampusInsight incorpora un modelo de suscripción a los logs necesarios y algoritmos de codificación y decodificación de datos.
El tercer paso es la distribución y el almacenamiento en búfer, es decir, el envío de datos 'en bruto' a Kafka para su distribución a servicios de análisis de nivel superior.
El cuarto paso es el análisis. Los algoritmos de Big Data e IA ayudan a procesar rápidamente los datos 'en bruto'. Como resultado, se identifican problemas individuales relacionados con:
- la autenticación (se soporta el protocolo Dot1x) y el funcionamiento de DHCP;
- la estabilidad y velocidad de la conexión;
- las interfaces inalámbricas;
- el funcionamiento de dispositivos individuales, incluidos 'detalles', como problemas con PoE o el cambio de un dispositivo de doble banda a 2.4 GHz;
- la calidad de los flujos de audio-video, aunque esta función solo se soporta para SIP no cifrado o para algunos conmutadores;
- el roaming entre diferentes puntos de acceso.
Los algoritmos de IA se utilizan para resolver tareas específicas, como la detección de interferencias entre canales durante la transmisión inalámbrica.

Quinto y último paso — el almacenamiento de datos en la base de datos distribuida en columnas Druid para su uso posterior.
El análisis de la información recogida teniendo en cuenta la 'línea base' construida con esos mismos datos históricos permite identificar patrones típicos de 'fallos' — definiendo KPI que corresponden a situaciones problemáticas y localizando problemas, sugiriendo soluciones. Así, el instrumento considera aproximadamente el 85% de todos los problemas en la red.

Los datos se presentan al administrador de forma gráfica de acuerdo con la jerarquía o la topología del espacio (por ejemplo, la distribución de la oficina). Se pueden construir 'mapas de calor', analizar cuán afectado está el equipo de determinadas plataformas o fabricantes, etc. Así es más fácil entender qué exactamente causó el problema.

En general, CampusInsight ofrece una gran cantidad de herramientas que permiten clasificar problemas, comparar a los usuarios afectados, estudiar datos sobre el desempeño de un cliente específico e incluso 'reproducir' los eventos que precedieron al incidente, para identificar rápidamente la fuente. Además, el producto admite el nuevo Wi-Fi 6, sin mencionar sus predecesores.
Casos de estudio
CampusInsight ya ha sido probado en la práctica, aunque la mayoría de los casos están cubiertos por NDA. El caso abierto más representativo es la aplicación de la herramienta de monitoreo en la red inalámbrica propia de Huawei.
La red abarca empresas con aproximadamente 180,000 empleados, de los cuales 80,000 pertenecen a la división de I+D (oficinas en más de 170 países, con un total de 62,000 puntos de acceso instalados).
La implementación de CampusInsight ha ayudado a optimizar más de 630 puntos de acceso, aumentando al mismo tiempo la eficiencia en la resolución de incidentes en un 30%.
A continuación, un par de situaciones concretas.
Ejemplo 1. Falla grupal
Los problemas de alto nivel, que se observan en un gran número de usuarios, a menudo son consecuencia de errores de bajo nivel. Y estos problemas no son tan fáciles de detectar. Por ejemplo, en una de las oficinas, muchos clientes móviles tenían dificultades con la autenticación, a pesar de que la configuración era correcta y no había problemas con el servidor La visualización de datos a diferentes niveles permitió identificar rápidamente que la fuente del problema era un switch que estaba generando demasiados errores. Para solucionar la situación, solo fue necesario reemplazar un tramo de cable. La localización y resolución del problema tomaron 90 minutos.
Ejemplo 2. Seguimiento de la calidad de roaming
La recopilación de datos sobre el recorrido de un cliente específico dentro de una red distribuida permite identificar problemas de roaming no evidentes. Un caso común es cuando los usuarios móviles enfrentan problemas para conectarse a la red en ciertas áreas del edificio (aunque, aparentemente, el correspondiente punto de acceso funcione correctamente). Una de las fuentes de tales problemas puede ser la potencia excesiva del punto de acceso en una habitación vecina, lo que provoca que, en lugar de conectarse al punto más cercano, el cliente intente conectarse a aquel que ya está atendiendo a un gran número de usuarios (caso real: conexión a un punto de acceso en una sala de conferencias mientras el usuario simplemente pasa enfrente).
Para resolver el problema, a veces basta con reducir la potencia de la señal del punto sobrecargado, aunque la identificación de esto requiere un análisis profundo de los problemas recurrentes en las salas adyacentes a la sala de conferencias.
Siguiendo las tendencias en el desarrollo de redes inalámbricas, se puede anticipar que no solo los gigantes con miles de puntos de acceso enfrentarán problemas de servicio en el futuro cercano, sino también las pequeñas y medianas empresas, que hasta ahora pueden limitarse a trabajar en función de los incidentes. Ante tal desarrollo, es lógico estar atentos a nuevas normas más eficaces y equipos de alto rendimiento. Pero también hay que recordar la necesidad de un cambio en la paradigma de mantenimiento de la red, antes de que los clientes comiencen una migración masiva hacia competidores debido a la calidad del servicio.
Por supuesto, el producto clase CampusInsight proporciona el mayor beneficio en implementaciones a gran escala, pero ahora también está disponible una suscripción en la nube para el servicio desde el Public Cloud local de Huawei, diseñada para implementaciones en el sector de las pymes. En general, los interesados pueden probar todo y "jugar" ya mismo.
Fuente: habr.com
