
Cómo actualizar el equipo de red en una gran empresa sin detener la producción? Sobre el gran proyecto en modo "cirugía a corazón abierto" habla el gerente de gestión de proyectos de Linxdatacenter, Oleg Fedorov.
En los últimos años, hemos notado un aumento en la demanda de los clientes por servicios relacionados con el componente de red de la infraestructura de TI. La necesidad de conexión de sistemas de TI, servicios, aplicaciones, así como las tareas de monitoreo y gestión operativa del negocio en prácticamente cualquier campo están obligando a las empresas a prestar mayor atención a las redes.
El rango de solicitudes varía desde garantizar la resistencia de la red hasta la creación y gestión de un sistema autónomo para clientes, incluyendo la adquisición de un bloque direcciones IP, la configuración de protocolos de enrutamiento y la gestión del tráfico de acuerdo con las políticas de las organizaciones.
También está creciendo la demanda de soluciones integrales para la construcción y mantenimiento de la infraestructura de red, principalmente por parte de clientes cuya infraestructura de red se está creando desde cero o que ha quedado obsoleta, requiriendo una modificación significativa.
Esta tendencia ha coincidido en el tiempo con el desarrollo y la complejización de nuestra propia infraestructura de red en Linxdatacenter. Hemos ampliado nuestra presencia geográfica en Europa conectándonos a ubicaciones remotas, lo que a su vez requirió la mejora de la infraestructura de red.
La empresa lanzó un nuevo servicio para clientes, Network-as-a-Service: nos encargamos de todas las tareas de red de los clientes, permitiéndoles centrarse en su negocio principal.
En el verano de 2020, se completó el primer gran proyecto en esta dirección, del cual nos gustaría hablar.
Al inicio
Un gran complejo industrial se acercó a nosotros para modernizar la parte de red de la infraestructura en una de sus plantas. Era necesario reemplazar el equipo antiguo por nuevo, incluyendo el núcleo de la red.
La última modernización del equipo en la planta tuvo lugar hace aproximadamente 10 años. La nueva dirección de la empresa decidió mejorar la conectividad, comenzando por la actualización de la infraestructura en el nivel físico más básico.
El proyecto se dividió en dos partes: la actualización del parque de servidores y del equipo de red. Nosotros éramos responsables de la segunda parte.
Los requisitos básicos de los trabajos incluían minimizar el tiempo de inactividad de las líneas de producción de la empresa durante la ejecución de los trabajos (y en algunas áreas, evitar por completo el tiempo de inactividad). Cualquier parada significa pérdidas económicas directas para el cliente, lo cual no debía ocurrir bajo ninguna circunstancia. Debido al modo de operación del sitio 24/7/365, y considerando la ausencia total de períodos de inactividad planificada en la práctica de la empresa, se nos planteó la tarea, en esencia, de realizar la operación a corazón abierto. Esta fue la principal característica diferenciadora del proyecto.
Vamos
Los trabajos se planificaron siguiendo el principio de movernos desde los nodos de la red más alejados del núcleo hacia los más cercanos, así como desde aquellos que impactan menos en el funcionamiento de las líneas de producción hacia los que tienen un impacto directo.
Por ejemplo, si tomamos un nodo de la red en el departamento de ventas, una interrupción de la comunicación como resultado de los trabajos en dicho departamento no afectará la producción. Al mismo tiempo, tal incidente nos ayudará como contratistas a verificar la corrección del enfoque adoptado para trabajar en tales nodos y, corrigiendo nuestras acciones, proceder a las siguientes etapas del proyecto.
Es necesario no solo reemplazar los nodos y cables de la red, sino también configurar correctamente todos los componentes para el funcionamiento adecuado de la solución en su conjunto. Las configuraciones se verificaron de esta manera: comenzando los trabajos alejándonos del núcleo, nos dábamos como si fuera un «derecho al error», sin poner en riesgo áreas críticas para el funcionamiento de la empresa.
Definimos zonas que no afectan el proceso productivo, así como secciones críticas: talleres, bloque de carga y descarga, almacenes, etc. En los puntos clave, se acordó con el cliente un tiempo de inactividad aceptable para cada nodo de la red individualmente: de 1 a 15 minutos. Evitar por completo la desconexión de nodos individuales de la red era imposible, ya que el cable debía ser cambiado físicamente del equipo antiguo al nuevo, y en el proceso de cambio también era necesario desenredar la 'maraña' de cables que se había formado a lo largo de varios años de operación sin el adecuado mantenimiento (una de las consecuencias de subcontratar los trabajos de instalación de cables).
Los trabajos se dividieron en varias etapas.
Etapa 1 – Auditoría. Preparación y acuerdo del enfoque para la planificación del trabajo y evaluación de la preparación de los equipos: cliente, contratista que realiza la instalación y nuestro equipo.
Etapa 2 – Desarrollo del formato para la realización de trabajos, con un análisis profundo y detallado y planificación. Se eligió el formato de lista de verificación con una indicación exacta del orden y la secuencia de las acciones, hasta el orden de cambio de los cables de parche en los puertos.
Etapa 3 – Realización de trabajos en armarios que no afectan la producción. Evaluación y ajuste del tiempo de inactividad para las etapas posteriores del trabajo.
Etapa 4 – Realización de trabajos en armarios que afectan directamente la producción. Evaluación y ajuste del tiempo de inactividad para la etapa final del trabajo.
Etapa 5 – Realización de trabajos en el centro de datos para cambiar el resto del equipo. Activación de la red en el nuevo núcleo.
Etapa 6 – Cambio secuencial del núcleo del sistema de las antiguas configuraciones de red a las nuevas para una transición fluida de todo el complejo del sistema (VLAN, enrutamiento, etc.). En esta etapa conectamos a todos los usuarios y trasladamos todos los servicios a nuevo equipo, verificamos la corrección de las conexiones, nos aseguramos de que ninguno de los servicios de la empresa se detuvo, y garantizamos que en caso de cualquier problema, estuviera directamente asociado con el núcleo, lo que facilitó la eliminación de posibles fallos y el ajuste final.
Peinado de la 'barba' de cables
El proyecto resultó ser complicado también por las difíciles condiciones iniciales.
En primer lugar, la gran cantidad de nodos y tramos de red, con una topología enredada y una clasificación de los cables según su propósito. Tales 'barbas' debían ser extraídas de los armarios y meticulosamente 'peinadas', aclarando de dónde venía cada cable y a dónde iba.
Se veía más o menos así:

así que:

o así:

En segundo lugar, para cada tarea similar, era necesario preparar un archivo con la descripción del proceso. "Tomamos el cable X del puerto 1 del equipo viejo y lo conectamos al puerto 18 del nuevo equipo". Suena simple, pero cuando tienes 48 puertos completamente ocupados y no hay opción para el tiempo de inactividad (recordemos el 24x7x365), la única salida es trabajar en bloques. Cuantos más cables se puedan sacar del equipo viejo a la vez, más rápido se pueden organizar e insertar en el nuevo "hardware" de red, evitando fallos y tiempos muertos en la red.
Por eso, en la fase de preparación, realizamos la división de la red en bloques, cada uno de los cuales pertenecía a un VLAN específico. Cada puerto (o su subconjunto) en el equipo viejo corresponde a alguno de los VLAN en la nueva topología de red. Los agrupamos así: en los primeros puertos del conmutador se ubicaron las redes de usuarios, en el medio las redes de producción, y en los últimos, los puntos de acceso y uplinks.
Este enfoque permitió extraer y organizar no 1, sino 10-15 cables del equipo viejo a la vez. Esto aceleró el proceso de trabajo varias veces.
Por cierto, así lucen los cables en los armarios después de ser organizados:

o, por ejemplo, así:

Tras completar la segunda etapa, tomamos un momento para analizar los errores y la dinámica del proyecto. Por ejemplo, salieron a la luz pequeños errores debido a imprecisiones en los esquemas de red que nos fueron proporcionados (conectores incorrectos en el esquema - parcheo de cable incorrecto comprado y necesidad de reemplazo).
La pausa fue necesaria, ya que al trabajar con servidores, incluso el más pequeño fallo en el proceso era inaceptable. Si el objetivo era asegurar un tiempo de inactividad en la sección de red de no más de 5 minutos, no se podía superar ese tiempo. Cualquier posible desviación del cronograma debía ser aprobada por el cliente.
Sin embargo, la planificación preliminar y la división del proyecto en bloques permitieron cumplir con el tiempo de inactividad previsto en todas las secciones, y en la mayoría de los casos, incluso prescindir de él.
Desafío del tiempo: proyecto bajo COVID
Sin embargo, no estuvieron ausentes las dificultades adicionales. Por supuesto, uno de los obstáculos fue el coronavirus.
Los trabajos se complicaron debido a que comenzó la pandemia, y no fue posible que todos los especialistas involucrados en el proceso estuvieran presentes durante la realización de los trabajos en el sitio del cliente. Solo se permitieron en el sitio los empleados de la organización de montaje, mientras que el control se realizó a través de una sala en Zoom, donde estaban el ingeniero de red de Linxdatacenter, yo como líder del proyecto, el ingeniero de red del cliente responsable de la ejecución de los trabajos, y el equipo realizando las obras de montaje.
Durante los trabajos surgieron problemas no previstos, y tuvimos que hacer ajustes sobre la marcha. Esto permitió prevenir rápidamente el impacto del factor humano (errores en el esquema, errores en la determinación del estado de actividad de la interfaz, etc.).
Aunque el formato de trabajo a distancia parecía inusual al comienzo del proyecto, nos adaptamos bastante rápido a las nuevas condiciones y llegamos a la etapa final de los trabajos.
Iniciamos una configuración temporal de los ajustes de red para el funcionamiento paralelo de dos núcleos de red: el antiguo y el nuevo, con el objetivo de realizar una transición suave. Sin embargo, resultó que una línea innecesaria no se había eliminado del archivo de configuración del nuevo núcleo, y no se realizó la transición. Esto nos obligó a gastar un tiempo determinado en la búsqueda del problema.
Se descubrió que el tráfico principal se transmitía correctamente, mientras que el tráfico de gestión no alcanzaba el nodo a través del nuevo núcleo. Gracias a la clara división del proyecto en etapas, pudimos identificar rápidamente la sección de la red donde se produjo la dificultad, identificar el problema y solucionarlo.
Y como resultado
Resultados técnicos del proyecto
Primero que nada, se creó un nuevo núcleo de la nueva red de la empresa, para lo cual construimos anillos físicos lógicos. Esto se hizo de tal manera que cada conmutador en la red tuviera un 'segundo brazo'. En la red antigua, muchos conmutadores estaban conectados al núcleo a través de una única ruta, un solo brazo (uplink). Si se rompía, el conmutador quedaba completamente inaccesible. Y si varios conmutadores estaban conectados a través de un uplink, un accidente podía paralizar todo un departamento o línea de producción en la empresa.
En la nueva red, incluso un incidente de red bastante grave no podrá 'caer' toda la red o una parte significativa de ella bajo ningún escenario.
El 90 % de todo el equipo de red ha sido actualizado, se han retirado los convertidores de medios y ya no es necesario utilizar líneas de alimentación dedicadas para alimentar el equipo, gracias a la conexión a conmutadores PoE, donde la electricidad se suministra a través de cables Ethernet.
Además, se han etiquetado todas las conexiones ópticas en el centro de datos y en los armarios en el lugar, en todos los puntos clave de conexión. Esto ha permitido preparar un esquema topológico del equipo y las conexiones en la red, reflejando su estado actual.
Esquema de la red

El resultado más importante desde un punto de vista técnico es que se realizaron trabajos de infraestructura de gran envergadura rápidamente, sin causar molestias en las operaciones de la empresa y prácticamente sin que el personal lo notara.
Resultados empresariales del proyecto
En mi opinión, este proyecto es interesante principalmente desde una perspectiva organizativa, ya que la complejidad radicaba en la planificación y la elaboración de pasos para llevar a cabo las tareas del proyecto.
El éxito del proyecto permite afirmar que nuestra iniciativa para desarrollar la dirección de red en el marco del portafolio de servicios de Linxdatacenter es la elección correcta para la dirección del crecimiento de la empresa. Un enfoque responsable en la gestión de proyectos, una estrategia bien pensada y una planificación clara nos permitieron llevar a cabo el trabajo a un nivel adecuado.
La confirmación de la calidad del trabajo es una solicitud del cliente para continuar brindando servicios de modernización de la red en sus otras instalaciones en Rusia.
Fuente: habr.com
