Network-as-a-Service pentru o mare companie: un caz neobișnuit

Network-as-a-Service pentru o mare companie: un caz neobișnuit
Cum să actualizăm echipamentele de rețea într-o mare întreprindere fără a opri producția? Despre un proiect pe scară largă în modul „operație pe inimă deschisă” vorbește managerul de gestionare a proiectelor Linxdatacenter, Oleg Fedorov. 

În ultimii câțiva ani, am observat o cerere crescută din partea clienților pentru servicii legate de componentele de rețea ale infrastructurii IT. Necesitatea conectivității sistemelor IT, serviciilor, aplicațiilor, sarcinile de monitorizare și gestionare operațională a afacerii în aproape orice domeniu determină astăzi companiile să acorde o atenție sporită rețelelor.  

Gama de solicitări variază de la asigurarea rezilienței rețelei până la crearea și gestionarea unui sistem autonom pentru clienți, cu achiziția de echipamente adreselor IP, configurarea protocoalelor de rutare și gestionarea traficului conform politicilor organizațiilor.

De asemenea, crește cererea pentru soluții complexe de construcție și întreținere a infrastructurii de rețea, în primul rând din partea clienților ale căror infrastructuri de rețea sunt construite de la zero sau sunt moral depășite, necesitând modificări serioase. 

Această tendință s-a desfășurat în paralel cu perioada de dezvoltare și complicare a propriei infrastructuri de rețea Linxdatacenter. Ne-am extins geografia prezenței noastre în Europa prin conectarea la site-uri îndepărtate, ceea ce a necesitat, la rândul său, îmbunătățirea infrastructurii rețelei. 

Compania a lansat un nou serviciu pentru clienți, Network-as-a-Service: ne asumăm soluționarea tuturor sarcinilor de rețea ale clienților, permițându-le să se concentreze asupra afacerii principale.

În vara anului 2020, s-a încheiat primul mare proiect în această direcție, despre care ne-ar plăcea să vorbim. 

La început 

Un mare complex industrial s-a adresat nouă pentru modernizarea părții de rețea a infrastructurii pe unul dintre site-urile sale. Era necesară înlocuirea echipamentului vechi cu unul nou, inclusiv nucleul rețelei.

Ultima modernizare a echipamentului din întreprindere a avut loc acum aproximativ 10 ani. Noua conducere a companiei a decis să îmbunătățească conectivitatea, începând cu actualizarea infrastructurii la cel mai de bază, nivel fizic. 

Proiectul a fost împărțit în două părți: upgrade-ul serverelor și echipamentelor de rețea. Noi am fost responsabili pentru a doua parte. 

Cerințele de bază pentru lucrări au inclus minimizarea timpilor de nefuncționare a liniilor de producție ale întreprinderii în timpul desfășurării lucrărilor (iar în unele zone, excluderea completă a timpilor de nefuncționare). Orice oprire înseamnă pierderi financiare directe pentru client, ceea ce nu trebuia să se întâmple în niciun caz. Având în vedere regimul de lucru al obiectivului 24x7x365 și lipsa totală a perioadelor de nefuncționare planificate în practica întreprinderii, ne-a fost stabilită sarcina de a efectua, în esență, o operațiune pe un inimă deschisă. Aceasta a devenit caracteristica principală a proiectului.

Să incepem

Lucrările au fost planificate conform principiului de a se deplasa de la nodurile rețelei îndepărtate de nucleu către cele mai apropiate, precum și de la cele care au un impact mai mic asupra funcționării liniilor de producție către cele care influențează direct această activitate. 

De exemplu, dacă luăm nodul rețelei din departamentul de vânzări, o întrerupere a comunicației ca urmare a lucrărilor din acest departament nu va afecta în niciun fel producția. Totuși, un astfel de incident ne va ajuta, ca subcontractori, să verificăm corectitudinea abordării aleasă pentru lucrul cu astfel de noduri și, corectând acțiunile, să lucrăm la etapele următoare ale proiectului. 

Trebuie să înlocuim nu doar nodurile și firele din rețea, ci și să configurăm corect toate componentele pentru funcționarea adecvată a soluției în ansamblu. Configurațiile au fost verificate astfel: începând lucrările de la distanța față de nucleu, ne-am acordat practic un „drept la greșeală”, neexpunând la risc secțiunile critice ale activității întreprinderii. 

Am identificat zonele care nu afectează procesul de producție, precum și secțiunile critice – atelierele, blocul de încărcare-descărcare, depozitele etc. La punctele cheie, cu clientul a fost convenit timpul acceptabil de nefuncționare pentru fiecare nod al rețelei în parte: de la 1 la 15 minute. Evitarea completă a deconectării unor noduri ale rețelei a fost imposibilă, deoarece cablul trebuie deconectat fizic din echipamentele vechi în cele noi, iar în procesul de comutare trebuie, de asemenea, să desfășurăm „părul” de fire, care s-a format în perioada de câțiva ani de exploatare fără întreținere corespunzătoare (una dintre consecințele externalizării muncii de instalare a liniilor de cablu).

Lucrările au fost împărțite în mai multe etape.

Etapa 1 – Audit. Pregătirea și agrearea abordării pentru planificarea lucrărilor și evaluarea pregătirii echipelor: clientul, contractorul ce efectuează montajul și echipa noastră.

Etapa 2 – Elaborarea formatului pentru desfășurarea lucrărilor, cu o analiză detaliată și o planificare profundă. Am ales formatul listei de verificare, cu specificarea exactă a ordinii și secvenței acțiunilor, până la secvența de comutare a cablurilor patch pe porturi.

Etapa 3 – Derularea lucrărilor în dulapuri care nu influențează producția. Evaluarea și corectarea timpului de nefuncționare pentru etapele ulterioare de lucrări.

Etapa 4 – Derularea lucrărilor în dulapuri care influențează direct producția. Evaluarea și corectarea timpului de nefuncționare pentru etapa finală a lucrărilor.

Etapa 5 – Derularea lucrărilor în sala serverelor pentru comutarea echipamentului rămas. Lansarea pe rutare pe noul nucleu.

Etapa 6 – Comutarea succesivă a nucleului sistemului de la configurațiile de rețea vechi la cele noi pentru o tranziție lină a întregului complex de sistem (VLAN, rutare etc.). În această etapă, am conectat toți utilizatorii și am transferat toate serviciile pe noul echipament, am verificat corectitudinea conexiunii, ne-am asigurat că niciunul dintre serviciile întreprinderii nu s-a oprit, garantând că, în caz de apariția unor probleme, acestea ar fi legate direct de nucleu, ceea ce a facilitat rezolvarea posibilelor defecțiuni și configurarea finală. 

Frizura cablurilor

Proiectul s-a dovedit a fi complicat și din cauza condițiilor inițiale complexe. 

În primul rând, este vorba despre un număr uriaș de noduri și porțiuni de rețea, cu o topologie complicată și clasificarea cablurilor în funcție de destinația lor. Astfel de 'frizuri' trebuiau scoase din dulapuri și aranjate cu grijă, stabilind fiecare cablu de unde provine și unde duce. 

Asta arăta aproximativ așa:

Network-as-a-Service pentru o mare companie: un caz neobișnuit
așa:

Network-as-a-Service pentru o mare companie: un caz neobișnuit
sau așa: 

Network-as-a-Service pentru o mare companie: un caz neobișnuit
În al doilea rând, pentru fiecare dintre aceste sarcini a fost necesar să pregătim un fișier cu descrierea procesului. „Luăm cablul X din portul 1 al echipamentului vechi, îl conectăm la portul 18 al noului echipament.” Părea simplu, dar când datele de intrare conțin 48 de porturi complet ocupate și opțiunea de oprire nu este disponibilă (ne amintim de 24x7x365), singura soluție este să lucrăm pe blocuri. Cu cât putem scoate mai multe cabluri din echipamentul vechi simultan, cu atât mai repede putem să le aranjăm și să le introducem în noua „coroană” de rețea, evitând întreruperile și opririle în funcționarea rețelei. 

Prin urmare, în etapa de pregătire am realizat o împărțire a rețelei în blocuri – fiecare dintre acestea coresponda unui VLAN specific. Fiecare port (sau un subset al acestora) de pe echipamentul vechi era un VLAN din noua topologie a rețelei. Le-am grupat astfel: pe primele porturi ale switch-ului s-au plasat rețelele utilizatorilor, în mijloc – rețelele de producție, iar pe ultimele – punctele de acces și uplink-urile. 

Această abordare a permis, într-o singură mișcare, să scoatem și să aranjăm din echipamentul vechi nu un cablu, ci 10-15. Acest lucru a accelerat semnificativ procesul de lucru.  

Apropo, iată cum arată cablurile în dulapuri după ce au fost aranjate: 

Network-as-a-Service pentru o mare companie: un caz neobișnuit
sau, de exemplu, așa: 

Network-as-a-Service pentru o mare companie: un caz neobișnuit
După finalizarea etapei a 2-a, am luat o pauză pentru analiza erorilor și dinamica proiectului. De exemplu, imediat au ieșit la iveală mici neajunsuri din cauza inexactităților din schemele de rețea furnizate (conector greșit în schemă – patch cord greșit cumpărat și necesitatea de a-l înlocui). 

Pauza a fost necesară, deoarece, lucrând cu serverul, orice mic eșec în proces era inadmisibil. Dacă s-a stabilit obiectivul de a asigura un timp de nefuncționare în segmentul rețelei de maximum 5 minute, acesta nu putea fi depășit. Orice abateri posibile de la program trebuiau să fie coordonate cu clientul. 

Cu toate acestea, planificarea prealabilă și împărțirea proiectului în blocuri au permis respectarea timpului de nefuncționare planificat pe toate segmentele, iar în cele mai multe cazuri s-a reușit chiar să ne descurcăm fără acesta. 

Provocarea timpului – proiectul sub COVID 

Fără dificultăți suplimentare, totuși, nu s-a putut. Desigur, coronavirusul a fost unul dintre obstacole. 

Lucrările au fost complicate de faptul că a început pandemia și nu a fost posibil ca toți specialiștii implicați în proces să fie prezenți pe șantierul clientului. Pe șantier au fost acceptați doar angajații organizației de montaj, iar controlul a fost realizat printr-o cameră în Zoom – în care s-au aflat inginerul de rețea din partea Linxdatacenter, eu ca manager de proiect, inginerul de rețea din partea clientului, responsabil pentru desfășurarea lucrărilor, și echipa care executa lucrările de montaj.

Pe parcursul lucrărilor au apărut probleme neprevăzute, iar ajustările au trebuit făcute pe parcurs. Astfel, am reușit să prevenim rapid influența factorului uman (erori în schemă, erori în determinarea statutului de activitate a interfeței etc.).

Deși formatul de lucru la distanță părea neobișnuit la începutul proiectului, ne-am adaptat destul de repede la noile condiții și am ajuns în etapa finală a lucrărilor. 

Am lansat o configurație temporară a setărilor rețelei pentru a permite funcționarea în paralel a două nuclee de rețea – vechi și nou – pentru a asigura o tranziție lină. Totuși, s-a dovedit că nu fusese eliminată o linie inutilă din fișierul de configurație al noului nucleu, iar tranziția nu a avut loc. Acest lucru ne-a determinat să pierdem timp pentru a găsi problema. 

Am constatat că traficul principal era transmis corect, iar traficul de control nu ajungea la nod prin noul nucleu. Datorită separării clare a proiectului în etape, am reușit să stabilim destul de repede secțiunea de rețea unde a apărut dificultatea, să identificăm problema și să o remediem. 

Iar ca rezultat

Concluziile tehnice ale proiectului 

În primul rând, a fost creat un nou nucleu al noii rețele a întreprinderii, pentru care am construit inele fizice/logice. Aceasta a fost realizată astfel încât fiecare switch din rețea să aibă un «al doilea braț». În vechea rețea, multe switch-uri erau conectate la nucleu printr-o singură rută, un singur braț (uplink). Dacă acesta se rupea, switch-ul devenea complet inaccesibil. Iar dacă se conectau mai multe switch-uri printr-un singur uplink, o avarie afectua un întreg departament sau linie de producție a întreprinderii. 

În noua rețea, niciun incident de rețea sever nu va putea, în niciun scenariu, să «pune la pământ» întreaga rețea sau o porțiune semnificativă a acesteia. 

90% din echipamentele de rețea au fost actualizate, convertoarele de mediu au fost scoase din funcțiune, iar necesitatea de linii electrice dedicate pentru alimentarea echipamentelor a fost eliminată prin conectarea la switch-uri PoE, unde alimentarea se realizează prin cabluri Ethernet. 

De asemenea, toate conexiunile optice din sala serverului și din dulapuri la fața locului au fost marcate – în toate nodurile cheie ale rețelei. Acest lucru a permis pregătirea unui schema topologică a echipamentelor și conexiunilor din rețea, reflectând starea lor actuală. 

Schema rețelei
Network-as-a-Service pentru o mare companie: un caz neobișnuit
Cel mai important rezultat din punct de vedere tehnic: lucrările infrastructurale relativ ample au fost realizate rapid, fără a crea vreo perturbare în activitatea întreprinderii și practic fără ca personalul să observe. 

Rezultatele de afaceri ale proiectului

Din punctul meu de vedere, acest proiect este interesant în primul rând din perspectiva organizatorică, nu tehnică. Complexitatea a constatat în primul rând în planificarea și gândirea pașilor pentru implementarea sarcinilor de proiect. 

Succesul proiectului ne permite să afirmăm că inițiativa noastră de a dezvolta direcția de rețea în cadrul portofoliului de servicii Linxdatacenter este o alegere corectă în direcția de dezvoltare a companiei. O abordare responsabilă în gestionarea proiectelor, o strategie bine gândită și o planificare clară ne-au permis să realizăm lucrarea la un nivel adecvat. 

Confirmarea calității muncii este cererea din partea clientului pentru continuarea serviciilor de modernizare a rețelei în celelalte locații ale sale din Rusia.

Sursa: habr.com

Cumpără un hosting fiabil pentru site-uri cu protecție DDoS, servere VPS VDS 🔥 Cumpără un hosting fiabil pentru site-uri cu protecție DDoS, servere VPS VDS | ProHoster