
Hoe netwerkapparatuur in een groot bedrijf bij te werken zonder de productie stil te leggen? Over een grootschalig project in de modus ‘hart operatie’ vertelt projectmanagementmanager bij Linxdatacenter Oleg Fedorov.
In de afgelopen jaren hebben we een verhoogde vraag van klanten naar diensten gerelateerd aan het netwerkcomponent van IT-infrastructuren opgemerkt. De behoefte aan connectiviteit van IT-systemen, diensten, toepassingen, alsook de monitoring en operationeel beheer van bedrijven in vrijwel elke sector dwingen bedrijven vandaag de dag om meer aandacht aan netwerken te besteden.
Het scala aan verzoeken varieert van het waarborgen van netwerkresilience tot het creëren en beheren van een klant-specifiek autonoom systeem met de aanschaf van een blok IP-adressen, configuratie van routeringsprotocollen en verkeersbeheer volgens de beleidslijnen van de organisaties.
Ook groeit de vraag naar integrale oplossingen voor de opbouw en het onderhoud van netwerk infrastructuren, vooral van klanten wiens netwerk infrastructuur vanaf nul wordt ontworpen of moreel verouderd is en aanzienlijke aanpassingen vereist.
Deze trend komt samen met de periode van ontwikkeling en complicatie van de eigen netwerk infrastructuur van Linxdatacenter. We hebben onze geografische aanwezigheid in Europa uitgebreid door verbinding te maken met afgelegen locaties, wat op zijn beurt ook verbetering van de netwerkinfrastructuur vereiste.
Het bedrijf heeft een nieuwe dienst voor klanten gelanceerd, Network-as-a-Service: wij nemen de oplossing van alle netwerkproblemen van klanten op ons, zodat zij zich kunnen concentreren op hun kernactiviteiten.
In de zomer van 2020 werd het eerste grote project in deze richting afgerond, waarover we graag willen vertellen.
Bij de start
Een grote industriële complex wendde zich tot ons voor de modernisering van de netwerkcomponent van de infrastructuur op een van zijn locaties. Het was nodig om oude apparatuur te vervangen door nieuwe, inclusief het netwerkcentrum.
De laatste modernisering van de apparatuur in de onderneming vond ongeveer 10 jaar geleden plaats. De nieuwe leiding van het bedrijf besloot de connectiviteit te verbeteren, te beginnen met de update van de infrastructuur op het meest basale, fysieke niveau.
Het project werd verdeeld in twee delen: de upgrade van het serverpark en netwerkapparatuur. Wij waren verantwoordelijk voor het tweede deel.
De basisvereisten voor de werkzaamheden omvatten het minimaliseren van stilstanden van de productielijnen van het bedrijf tijdens de uitvoering van de werkzaamheden (en op sommige locaties zelfs het volledig uitsluiten van stilstanden). Elke stop betekent directe financiële verliezen voor de klant, wat onder geen enkele omstandigheid mocht gebeuren. Gezien de 24/7/365 bedrijfsvoering van het object en het volledige gebrek aan geplande stilstandperiodes in de praktijk van het bedrijf, werden we voor de uitdaging gesteld om in wezen een operatie 'op een open hart' uit te voeren. Dit werd de belangrijkste onderscheidende eigenschap van het project.
Laten we gaan
De werkzaamheden werden gepland op basis van een strakke volgorde van de knooppunten in het netwerk, beginnend bij de verder van de kern gelegen knooppunten tot dichterbij gelegen en van de knooppunten die minder invloed hebben op de werking van de productielijnen naar de knooppunten die deze werking rechtstreeks beïnvloeden.
Bijvoorbeeld, als we het knooppunt in de verkoopafdeling nemen, kan een probleem met de verbinding als gevolg van werkzaamheden in deze afdeling de productie niet beïnvloeden. Tegelijkertijd zal zo'n incident ons als aannemer helpen de juistheid van de gekozen aanpak voor dergelijke knooppunten te verifiëren en, door onze acties aan te passen, verder te werken in de volgende fasen van het project.
Het is noodzakelijk om niet alleen de knooppunten en kabels in het netwerk te vervangen, maar ook om alle componenten correct te configureren voor een goede werking van de oplossing als geheel. Juist de configuraties werden op deze manier getest: door de werkzaamheden te starten met het verwijderen van de kern, geven we onszelf als het ware 'recht op een fout', zonder risisco te nemen voor de kritische delen van de operatie van het bedrijf.
We hebben zones bepaald die geen invloed hebben op het productieproces, evenals kritische gebieden - werkplaatsen, laad- en losblokken, magazijnen, enz. Voor de belangrijkste plaatsen werd met de klant een acceptabele stilstandtijd voor elk netwerk knooppunt afzonderlijk afgesproken: van 1 tot 15 minuten. Het was niet mogelijk om volledig te voorkomen dat afzonderlijke knooppunten uitgeschakeld werden, omdat de kabel fysiek van de oude apparatuur naar de nieuwe moest worden omgeschakeld, en tijdens het omschakelen moest ook de 'baard' van de kabels, die zich in de loop van jaren zonder adequate zorg had gevormd, worden ontwarren (een van de gevolgen van het uitbesteden van de werkzaamheden voor het aanleggen van kabelverbindingen).
De werkzaamheden werden in verschillende fasen verdeeld.
Stap 1 – Audit. Voorbereiding en afstemming van de aanpak voor planningswerkzaamheden en beoordeling van de gereedheid van de teams: de klant, de opdrachtnemer die de installatie uitvoert, en ons team.
Stap 2 – Ontwikkeling van een format voor het uitvoeren van werkzaamheden, met een diepgaande gedetailleerde analyse en planning. We hebben gekozen voor een checklist-format met een nauwkeurige vermelding van de volgorde en sequentie van acties, tot aan de volgorde van het omwisselen van patchkabels tussen poorten.
Fase 3 – Uitvoering van werkzaamheden in kasten die geen invloed hebben op de productie. Beoordeling en aanpassing van de stilstandtijd voor de volgende werkfases.
Fase 4 – Uitvoering van werkzaamheden in kasten die directe invloed hebben op de productie. Beoordeling en aanpassing van de stilstandtijd voor de laatste werkfase.
Fase 5 – Uitvoering van werkzaamheden in de serverruimte voor het omwisselen van de resterende apparatuur. Activatie van de routering op de nieuwe kern.
Fase 6 – Geleidelijk omschakelen van de systeemkern van oude netwerkconfiguraties naar nieuwe voor een soepele overgang van het gehele systeemcomplex (VLAN, routering, enz.). In deze fase hebben we alle gebruikers aangesloten en alle diensten overgezet naar de nieuwe apparatuur, de juistheid van de verbinding gecontroleerd, ervoor gezorgd dat geen enkele dienst van het bedrijf is stopgezet, en gegarandeerd dat eventuele problemen direct verband hielden met de kern, wat het oplossen van mogelijke storingen en de uiteindelijke afstelling vergemakkelijkte.
De baard van kabels
Het project bleek ook uitdagend door de complexe uitgangsvoorwaarden.
Ten eerste is er het enorme aantal knooppunten en netwerkgedeelten, met een verwarrende topologie en classificatie van kabels op basis van hun bestemming. Dergelijke 'baarden' moesten uit de kasten worden gehaald en zorgvuldig 'gekamd', met inachtneming van welke kabel van waar komt en waarheen deze leidt.
Het zag er ongeveer zo uit:

zo:

of zo:

Ten tweede was het voor elke dergelijke taak nodig om een bestand met een beschrijving van het proces voor te bereiden. "Neem draad X uit poort 1 van de oude apparatuur en steek deze in poort 18 van de nieuwe apparatuur." Het klinkt eenvoudig, maar wanneer je in de oorspronkelijke gegevens 48 volledig bezette poorten hebt en er geen optie is voor stilstand (we denken aan 24/7/365), is de enige optie om in blokken te werken. Hoe meer draden je tegelijk uit de oude apparatuur kunt trekken, hoe sneller je ze kunt ordenen en in de nieuwe netwerkhardware kunt steken, zonder storingen of stilstand in het netwerk.
Daarom hebben we in de voorbereidende fase het netwerk in blokken verdeeld - elk daarvan was gerelateerd aan een specifieke VLAN. Elke poort (of een subset daarvan) op de oude apparatuur komt overeen met een van de VLAN's in de nieuwe netwerktopologie. We hebben ze als volgt gegroepeerd: in de eerste poorten van de switch bevinden zich de gebruikersnetwerken, in het midden de productienetwerken en in de laatste de toegangspunten en uplinks.
Deze aanpak stelde ons in staat om in één keer niet 1 draad, maar 10-15 draden uit de oude apparatuur te trekken en te ordenen. Dit versnelde het werkproces aanzienlijk.
Overigens, zo zien de draden in de kasten eruit na het ordenen:

of bijvoorbeeld zo:

Na het einde van de tweede fase hebben we een pauze ingelast voor de analyse van fouten en de dynamiek van het project. Bijvoorbeeld, er kwamen meteen kleine tekortkomingen aan het licht vanwege onnauwkeurigheden in de door ons ontvangen netwerkschema's (onjuiste connector op het schema - onjuiste aangekochte patch-kabel en de noodzaak deze te vervangen).
De pauze was noodzakelijk, omdat bij het werken met serverapparatuur zelfs een kleine fout in het proces onacceptabel was. Als het doel is om de stilstandtijd op een deel van het netwerk tot niet meer dan 5 minuten te beperken, dan mocht dit niet worden overschreden. Elke mogelijke afwijking van de planning moest met de klant worden afgestemd.
Echter, de voorafgaande planning en de opsplitsing van het project in blokken maakten het mogelijk om binnen de geplande stilstandtijd in alle delen te blijven, en in de meeste gevallen zelfs zonder stilstand te werken.
De uitdaging van deze tijd - een project onder COVID-19
Desondanks was het niet zonder extra moeilijkheden. Natuurlijk was het coronavirus een van de obstakels.
De werkzaamheden werden bemoeilijkt doordat de pandemie begon, waardoor het voor alle betrokken specialisten onmogelijk was om aanwezig te zijn op de site van de klant tijdens de uitvoering van de werkzaamheden. Alleen medewerkers van de montageteams hadden toegang tot de site, terwijl de controle plaatsvond via een Zoom-vergadering, waar de netwerkingenieur van Linxdatacenter, ik als projectleider, de netwerkingenieur van de klant, verantwoordelijk voor de uitvoering van de werkzaamheden, en het team dat de montage uitvoerde aanwezig waren.
Tijdens de werkzaamheden ontstonden onverwachte problemen, waardoor we ter plaatse aanpassingen moesten doorvoeren. Dit stelde ons in staat om snel de invloed van menselijke factoren (fouten in de schema's, fouten bij het bepalen van de status van de interface en dergelijke) te voorkomen.
Hoewel het op afstand werken in het begin van het project ongewoon leek, hebben we ons vrij snel aangepast aan de nieuwe omstandigheden en zijn we op de laatste fase van de werkzaamheden gekomen.
We hebben een tijdelijke configuratie van de netwerkinstellingen opgezet voor de gelijktijdige werking van twee netwerkcores - de oude en de nieuwe - om een soepele overgang te realiseren. Het bleek echter dat er een overbodige regel in het configuratiebestand van de nieuwe core was blijven staan, waardoor de overgang niet plaatsvond. Dit dwong ons om enige tijd te besteden aan het opsporen van het probleem.
Het bleek dat de hoofdtalking correct werd doorgegeven, maar dat het beheerverkeer het knooppunt via de nieuwe core niet bereikte. Door het project duidelijk in fasen op te splitsen, kon de sectie van het netwerk waar het probleem zich voordeed snel worden vastgesteld, de oorzaak worden vastgesteld en deze worden opgelost.
En als resultaat
Technische resultaten van het project
In de eerste plaats is er een nieuwe core van het bedrijfsnetwerk gecreëerd, waarvoor we fysieke/logische ringen hebben gebouwd. Dit is gedaan zodat elke switch in het netwerk een "tweede arm" kreeg. In het oude netwerk waren veel switches verbonden met de core via één route, één arm (uplink). Als deze faalde, werd de switch volledig onbereikbaar. En als meerdere switches via één uplink waren aangesloten, veroorzaakte een storing dat een heel departement of productielijn in het bedrijf uitviel.
In het nieuwe netwerk zal zelfs een ernstige netwerkincident in geen enkel scenario het hele netwerk of een belangrijk deel ervan kunnen "platleggen".
90% van de totale netwerkinfrastructuur is vernieuwd, mediaconverters (signaalverspreidingsomzetters) zijn buiten gebruik gesteld en de noodzaak voor aparte stroomlijnen om apparatuur van stroom te voorzien is opgeheven door aansluiting op PoE-switches, waar voeding via Ethernet-kabels wordt geleverd.
Bovendien zijn alle optische verbindingen in de serverruimte en in de kasten ter plaatse gemarkeerd – op alle belangrijke knooppunten van de communicatie. Dit heeft het mogelijk gemaakt een topologische kaart van de apparatuur en verbindingen in het netwerk op te stellen, die de actuele staat ervan weergeeft.
Netwerkdiagram

De belangrijkste conclusie uit technisch oogpunt: de aanzienlijke infrastructuurwerken zijn snel uitgevoerd, zonder enige hinder voor de bedrijfsvoering en bijna onmerkbaar voor het personeel.
Zakelijke conclusies van het project
Volgens mij is dit project vooral interessant vanuit organisatorisch oogpunt en niet zozeer vanuit technisch oogpunt. De uitdaging lag vooral in het plannen en doordacht uitvoeren van de stappen voor de realisatie van de projectdoelen.
Het succes van het project stelt ons in staat om te zeggen dat onze initiatieven voor de ontwikkeling van het netwerksegment binnen het serviceportfolio van Linxdatacenter – de juiste ontwikkelingsrichting voor het bedrijf zijn. Een verantwoordelijk projectmanagement, een doordachte strategie en duidelijke planning stelden ons in staat om het werk op het juiste niveau uit te voeren.
Een bevestiging van de kwaliteit van ons werk is het verzoek van de klant om de diensten voor netwerkverbetering op zijn andere locaties in Rusland voort te zetten.
Bron: habr.com
