Acest articol este primul dintr-o serie intitulată „Cum să-ți controlezi infrastructura de rețea”. Conținutul tuturor articolelor din serie și linkurile pot fi găsite .
Accept că există suficiente companii unde o simplă rețea timp de o oră sau chiar o zi nu este critică. Din păcate sau din fericire, nu am avut ocazia să lucrez în astfel de locuri. Totuși, rețelele sunt diferite, cerințele sunt diferite, abordările sunt diferite și totuși, într-un fel sau altul, lista de mai jos va fi în multe cazuri de fapt, un „must-do”.
Așadar, condițiile inițiale.
Ești la un nou loc de muncă sau ai fost promovat sau ai decis să privești diferit îndatoririle tale. Rețeaua companiei este responsabilitatea ta. Pentru tine, aceasta este într-o mare măsură o provocare și o noutate, ceea ce justifică într-o oarecare măsură tonul mentorului al acestui articol :). Dar, sper că articolul poate fi de asemenea util pentru orice inginer de rețea.
Primul tău obiectiv strategic este să înveți să faci față entropiei și să menții nivelul serviciului oferit.
Multe dintre sarcinile descrise mai jos pot fi rezolvate prin diverse mijloace. În mod intenționat nu abordez tema implementării tehnice, deoarece, în principiu, adesea nu contează cum ai rezolvat o anumită problemă, ci contează cum folosești acea soluție și dacă o folosești de fapt. De exemplu, nu este prea util sistemul tău de monitorizare bine construit profesional, dacă nu te uiți acolo și nu reacționezi la alerte.
Echipament
Mai întâi trebuie să înțelegi unde sunt cele mai mari riscuri.
Din nou, poate fi diferit. Accept că undeva, de exemplu, ar putea fi probleme de securitate, iar în altă parte ar putea fi probleme legate de continuitatea serviciului, iar în altă parte, poate fi altceva. De ce nu?
Să presupunem, pentru certitudine, că este vorba despre continuitatea serviciului (așa a fost în toate companiile în care am lucrat).
Atunci trebuie să începi cu echipamentul. Iată lista de subiecte la care trebuie să acorzi atenție:
- clasificarea echipamentului în funcție de gradul de criticitate
- rezervarea echipamentului critic
- asistență, licențe
Trebuie să luați în considerare posibilele variante de defecțiuni, mai ales cu echipamentele aflate în vârful clasificării dumneavoastră de criticitate. De obicei, se neglijează probabilitatea de probleme duble; altfel, soluția și suportul pot deveni nemeritat de scumpe, dar în cazul elementelor cu adevărat critice ale rețelei, a căror defecțiune poate afecta semnificativ afacerea, trebuie să luați în considerare și acest aspect.
Exemplu
Să presupunem că vorbim despre switch-ul principal din data center.
Având în vedere că ne-am înțeles că continuitatea serviciului este cel mai important criteriu, este logic să asigurați o rezervare „fierbinte” (redundancy) a acestui echipament. Dar asta nu este tot. Trebuie să determinați și cât timp, în cazul defecțiunii primului switch, este acceptabil pentru dumneavoastră să funcționați cu un singur switch rămas, având în vedere riscul ca și acesta să se defecteze.
Important! Nu trebuie să luați această decizie singuri. Trebuie să descrieți riscurile, soluțiile posibile și costurile conducerii sau managementului companiei. Deciziile trebuie să le ia ei.
Astfel, dacă s-a decis că, având în vedere o probabilitate mică de defecțiune dublă, funcționarea timp de 4 ore pe un singur switch este acceptabilă, puteți opta pur și simplu pentru un suport corespunzător (în care echipamentul va fi înlocuit în termen de 4 ore).
Dar există riscul să nu ajungă. Din păcate, am fost odată în această situație. În loc de patru ore, echipamentul a venit după o săptămână!!!
De aceea, acest risc trebuie discutat și, poate, ar fi mai bine să cumpărați un alt switch (al treilea) și să-l păstrați în standby („rezervare rece”) sau să-l utilizați în scopuri de laborator.
Important! Creați o listă cu toate suporturile pe care le aveți, împreună cu datele de expirare, și adăugați-le în calendar, astfel încât cu cel puțin o lună înainte să primiți un e-mail care să vă reamintească că trebuie să începeți să vă faceți griji cu privire la reînnoirea suportului.
Nu vi se va ierta dacă uitați să reînnoiți suportul și în ziua următoare după ce acesta a expirat, echipamentul dumneavoastră se va defecta.
Lucrări de urgență
Indiferent ce se întâmplă în rețeaua dumneavoastră, în mod ideal, trebuie să păstrați accesul la echipamentul dumneavoastră de rețea.
Este important! Trebuie să aveți acces la consolă pentru tot hardware-ul și acest acces nu trebuie să depindă de funcționalitatea rețelei de transmitere a datelor.
De asemenea, trebuie să anticipați posibilele scenarii negative și să documentați acțiunile necesare. Accesibilitatea acestui document este de asemenea critică, așa că acesta trebuie să fie nu doar disponibil pe o resursă comună pentru departament, ci și salvat local pe calculatoarele inginerilor.
Este obligatoriu să existe
- informații necesare pentru a deschide o cerere de suport la furnizor sau integrator
- informații despre cum să accesați orice echipament (consolă, management)
De asemenea, poate conține orice alte informații utile, cum ar fi descrierea procedurii de upgrade a diferitelor echipamente și comenzi de diagnosticare utile.
Parteneri
Acum trebuie să evaluați riscurile asociate partenerilor. De obicei, sunt
- furnizorii de internet și punctele de schimb de trafic (IX)
- furnizorii de canale de comunicație
Ce întrebări trebuie să vă puneți? Așa cum s-a întâmplat și cu echipamentele, trebuie să luați în considerare diverse opțiuni ale situațiilor de urgență. De exemplu, pentru furnizorii de internet, aceasta poate fi ceva de genul:
- ce se va întâmpla dacă furnizorul de internet X nu vă mai oferă serviciul dintr-un anumit motiv?
- aveți suficiente lățimi de bandă de la ceilalți furnizori?
- cât de bună va rămâne conectivitatea?
- cât de independenți sunt furnizorii dumneavoastră de internet și va provoca o avarie majoră a unuia dintre ei probleme cu ceilalți?
- câte intrări optice există în centrul dvs. de date?
- ce se va întâmpla dacă una dintre intrări va fi complet distrusă?
În ceea ce privește intrările, în experiența mea din două companii diferite, în două locații diferite, de încredere un excavator a distrus puțurile și, doar dintr-o minune, fibra noastră optică a fost nelovită. Nu este un caz atât de rar.
Și, desigur, trebuie să nu doar să puneți aceste întrebări, ci, din nou, cu sprijinul conducerii, să asigurați o soluție acceptabilă în orice situație.
Backup
Următoarea prioritate poate fi backup-ul configurațiilor hardware-ului. În orice caz, acesta este un aspect foarte important. Nu voi enumera cazurile în care puteți pierde configurația, mai bine faceți backup regulat și nu gândiți la asta. În plus, backup-ul regulat poate fi foarte util în controlul modificărilor.
Important! Make backups daily. This is not such a large amount of data that you should skimp on it. In the morning, the on-duty engineer (or you) should receive a report from the system clearly indicating whether the backup was successful or not, and in the case of an unsuccessful backup, the problem should be resolved or a ticket should be created (see the processes of the network department).
Versiuni software
The question of whether to upgrade the software of the equipment is not so straightforward. On one hand, old versions come with known bugs and vulnerabilities, but on the other hand, new software is not always a painless upgrade process, and new bugs and vulnerabilities can arise.
Here, you need to find the optimal solution. A few obvious recommendations:
- only install stable versions
- you still shouldn’t stick to very old versions of the software
- create a table with information on which software is installed where
- periodically read reports on vulnerabilities and bugs in software versions, and in case of critical issues, consider upgrading
At this stage, having console access to the equipment, support information, and a description of the upgrade procedure, you are basically ready for this step. The ideal situation is when you have lab equipment where you can test the entire procedure, but unfortunately, that is not often the case.
In the case of critical equipment, you can contact the vendor support for assistance with the upgrade.
Sistem de ticketing
Now you can look around. You need to establish processes for interaction with other departments and within your own department.
This may not be mandatory (for example, if your company is small), but I would highly recommend organizing work in such a way that all external and internal tasks go through the ticketing system.
The ticketing system is essentially your interface for internal and external communications, and you should describe this interface with sufficient detail.
Let's take an important and commonly encountered task of granting access as an example. I will outline an algorithm that worked excellently in one company.
Exemplu
Să începem prin a spune că de multe ori clienții formulează cerințele de acces într-un limbaj neclar pentru inginerii de rețea, adică, în jargonul aplicației, de exemplu, „oferă-mi acces la 1C”.
De aceea, niciodată nu am acceptat cereri direct de la astfel de utilizatori.
Iar aceasta a fost prima cerință.
- Cererea de acces trebuie să vină din partea departamentelor tehnice (în cazul nostru, de la inginerii Unix, Windows, sau helpdesk).
A doua cerință este că
- acest acces trebuie să fie protocolat (de către departamentul tehnic de la care am primit cererea) și ca parte a cererii primim un link către acest acces protocolat.
Forma acestei cereri trebuie să fie clară pentru noi, adică
- cererea trebuie să conțină informații despre din ce subrețea și în ce subrețea trebuie să se deschidă accesul, precum și despre protocol și (în caz de tcp/udp) porturi.
De asemenea, trebuie să fie specificat
- descrierea motivului pentru care acest acces este deschis.
- Provizoriu sau permanent (dacă este provizoriu, atunci până la ce dată).
Și un punct foarte important este aprobările
- de la șeful departamentului care a inițiat accesul (de exemplu, de la contabilitate).
- De la șeful departamentului tehnic, de unde a venit această cerere către departamentul de rețea (de exemplu, helpdesk).
În acest context, „proprietarul” acestui acces este considerat șeful departamentului care a inițiat accesul (contabilitatea în exemplul nostru) și el este responsabil pentru menținerea actualizării paginii cu accesuri protocolate pentru acest departament.
Logare
Aceasta este o zonă în care te poți îneca. Dar dacă dorești să implementezi o abordare proactivă, trebuie să înveți să gestionezi acest flux de date.
Iată câteva recomandări practice:
- verificarea log-urilor trebuie să fie zilnică.
- În cazul unei verificări planificate (nu în caz de situație de urgență), poți să te limitezi la nivelurile de severitate (severity) 0, 1, 2 și să adaugi modele preferate din alte niveluri dacă crezi că este necesar.
- Scrie un script care analizează log-urile și ignoră acele log-uri a căror modele le-ai adăugat în lista de ignoranță.
Această abordare va permite, în timp, să creezi o listă de ignoranță a log-urilor care nu te interesează, lăsând doar acelea pe care le consideri cu adevărat importante.
La noi a funcționat excelent.
Monitorizare
Nu este o raritate ca o companie să nu aibă un sistem de monitorizare. Puteți, de exemplu, să vă bazați pe log-uri, dar echipamentul poate pur și simplu să «moară», fără să reușească să «spună» nimic, sau un pachet UDP din protocolul syslog poate să se piardă și să nu ajungă. În general, desigur, monitorizarea activă este importantă și necesară.
Două exemple foarte solicitate în practica mea:
- monitorizarea încărcării canalelor de comunicare, a legăturilor critice (de exemplu, conexiunea la furnizorii de servicii). Aceasta permite să observați proactiv o potențială problemă de degradare a serviciului din cauza pierderii de trafic și, prin urmare, să o evitați.
- graficele, construite pe baza NetFlow. Acestea permit identificarea ușoară a anomaliilor în trafic și sunt foarte utile pentru detectarea unor tipuri simple, dar semnificative de atacuri cibernetice.
Important! Configurați notificările SMS pentru cele mai critice evenimente. Acest lucru se aplică atât monitorizării, cât și logării. Dacă nu aveți un schimb de gardă, atunci mesajele SMS ar trebui să ajungă și în afara orelor de program.
Planificați procesul astfel încât să nu treziți toți inginerii. La noi, pentru aceasta, am avut un inginer de gardă.
Controlul modificărilor
Din punctul meu de vedere, nu este neapărat să controlați toate modificările. Dar, în orice caz, trebuie să aveți posibilitatea, dacă este necesar, să găsiți ușor cine și de ce a efectuat anumite modificări în rețea.
Câteva sfaturi:
- utilizați un sistem de tichet pentru o descriere detaliată a ceea ce s-a făcut în cadrul acestui tichet, de exemplu, copiind configurația aplicată în tichet.
- folosiți funcționalitățile comentariilor pe echipamentele de rețea (de exemplu, commit comment pe Juniper). Puteți nota numărul tichetului.
- utilizați diff-urile backup-urilor voastre de configurație.
Puteți introduce acest lucru ca un proces, revizuind zilnic toate tichetele pentru modificări.
Procese
Trebuie să formalizați și să descrieți procesele din echipa voastră. Dacă ați ajuns la acest punct, atunci în echipa voastră ar trebui să funcționeze deja cel puțin următoarele procese:
Procese zilnice:
- lucrul cu tichetele
- lucrul cu log-urile
- controlul modificărilor
- lista de verificare zilnică
Procese anuale:
- reînnoirea garanțiilor, licențelor
Procese asincrone:
- reacția la diferite situații de urgență
Concluzia primei părți
Ați observat că până acum nu discutăm despre configurarea rețelei, design, protocoalele de rețea, rutare sau securitate… Este ceva în jur. Dar, deși acestea pot părea plictisitoare, ele sunt elemente foarte importante ale activității unei divizii de rețea.
Până acum, așa cum observați, nu ați îmbunătățit nimic în rețeaua dumneavoastră. Dacă existau vulnerabilități în securitate, acestea au rămas neschimbate; dacă designul era slab, acesta a rămas. Până nu ați aplicat abilitățile și cunoștințele de inginer de rețea, pe care probabil le-ați acumulat cu mult timp, efort și, uneori, bani. Dar mai întâi trebuie să construiți (sau să întăriți) fundația, iar abia apoi să vă ocupați de construcție.
Despre cum să căutați și să remediați erorile, și apoi să îmbunătățiți infrastructura dumneavoastră – despre asta vorbesc următoarele părți.
Desigur, nu este necesar să faceți totul în ordine secvențială. Timpul poate fi critic. Faceți lucrurile în paralel, dacă resursele permit.
Și un aspect important. Comunicați, întrebați, consultați-vă cu echipa dumneavoastră. În cele din urmă, ei sunt cei care trebuie să întrețină și să implementeze toate acestea.
Sursa: habr.com
