Astăzi, în infrastructura IT, cu utilizarea pe scară largă a virtualizării, sistemele de stocare a datelor reprezintă nucleul care păstrează toate mașinile virtuale. Defecțiunea acestui nod poate opri complet funcționarea centrului de calcul. Deși o parte semnificativă a echipamentului serverelor are reziliență într-o formă sau alta „implicit”, datorită rolului special al sistemelor de stocare în cadrul unui centru de date, acestea impun cerințe ridicate în ceea ce privește „viabilitatea”.

Cea mai eficientă metodă de asigurare a rezilienței în IT este utilizarea mai multor instanțe de echipamente și software (în cel mai simplu caz – duplicare). Desigur, sistemul de stocare poate fi complet duplicat. Și pentru recuperarea în caz de dezastru, exact această abordare este folosită. Dar nu toate companiile își pot permite o astfel de soluție. Nu este vorba doar despre costul dublu al echipamentului, ci și despre celelalte cheltuieli necesare organizării unei astfel de soluții și menținerii acesteia.
Cu toate acestea, posibilitatea de duplicare a echipamentului nu elimină necesitatea de a asigura reziliența la nivelul componentelor. În special, în sistemele de stocare se aplică rezervarea pentru sursele de alimentare, modulele de răcire, unitățile de stocare și, bineînțeles, controlerele. Toate acestea au devenit de mult o normalitate. Este greu de găsit un sistem de stocare fără utilizarea unui astfel de design. aici – nu este o excepție. Dar în acest articol dorim să discutăm despre ceea ce nu sare imediat în ochi și care este destinat în principal creșterii rezilienței sistemului în ansamblu.
Modulele de răcire
Foarte des, în cazurile cu carcase de 2U-3U se folosesc module combinate, care conțin atât surse de alimentare, cât și ventilatoare. Pe de o parte, este convenabil, deoarece trebuie întreținut doar un singur modul. Pe de altă parte, dacă sistemul de răcire se defectează, sursa de alimentare poate fi deconectată în mod forțat pentru a preveni supraîncălzirea. Și deși situația nu pare a fi critică, nu ar trebui să adăugăm vulnerabilități sistemului de stocare.
Răcirea în sistemul de stocare Qsan este organizată sub formă de module separate cu înlocuire „pe cald”, independente de sursele de alimentare. În mod specific, blocurile de alimentare au propriile ventilatoare destinate răcirii acestora. Modulul de răcire conține două ventilatoare independente care se protejează reciproc. Există două astfel de module în sistemul de stocare: la dreapta și la stânga - pentru a asigura o răcire eficientă a tuturor componentelor. Dacă se defectează unul dintre ventilatoare, toate celelalte își vor crește automat turația pentru a compensa deficitul de flux de aer. Din acest motiv, defecțiunea unui ventilator nu prezintă un pericol de supraîncălzire pentru întregul dispozitiv.
Topologia de conectare a rafturilor de expansiune
Schema clasică de conectare la sistemul de stocare implică o topologie denumită cascada. În acest caz, controlerele corespunzătoare ale raftului și ale sistemului de stocare sunt conectate între ele printr-un singur cablu SAS. În total, se folosesc 2 cabluri pentru un sistem cu două controlere. Dacă se dorește conectarea celui de-al doilea, acesta se leagă în același mod de primul raft. Și așa mai departe. Avantajul acestei topologii este simplitatea implementării în echipamente. Totuși, un dezavantaj este vulnerabilitatea față de întreruperea bruscă a circuitului SAS din cauza defectării necorespunzătoare a controlerelor neconectate între ele și a raftului sau din cauza unei pene de curent pe unul dintre rafturile de expansiune din mijlocul circuitului. Ca rezultat, se va pierde accesul la o parte din unități și va exista posibilitatea distrugerii grupului RAID, dacă acesta este „dispersat” pe mai multe carcase.
Pentru a proteja împotriva defectării încrucișate a controlerelor, Qsan dispune de o protecție prin intermediul unei legături logice interne între controlere prin backplane-ul sistemului de stocare. Adică, controlerul sistemului de stocare vede nu doar controlerul JBOD, conectat direct la el, ci și controlerul „vecin” printr-un link special în backplane. Ca rezultat, dacă se va întâmpla o astfel de situație și nimeni nu va deconecta fizic cablurile SAS între sistemul de stocare și raft, accesul la toate unitățile va fi menținut.

Pentru a proteja împotriva întreruperii circuitului SAS, de exemplu, din cauza pierderii de alimentare a raftului de expansiune, se utilizează de obicei o altă topologie de conectare - cascada inversă. În acest caz, sistemul de stocare este conectat atât la primul, cât și la ultimul raft din circuit, obținând acces la unități ca și cum ar veni din ambele părți.

Dacă doriți o protecție mai puternică, puteți construi configurații mai mari, folosind, de exemplu, topologia arborelui. Sau puteți complica și mai mult prin combinarea topologiilor menționate. Acest lucru este posibil datorită numărului mare de conectori SAS pe dispozitive (2 pentru fiecare controller de stocare și 5 pentru fiecare controller JBOD) cu recunoașterea automată a modurilor de funcționare a intrărilor/ieșirilor. Cel mai important este ca administratorul să nu se streseze. Iar sistemul de stocare va putea să configureze corect configurația.
Reconstruire rapidă
Disponibilitatea discurilor de rezervă în sistem pentru înlocuire „pe loc” (hot spare) mărește semnificativ fiabilitatea stocării informațiilor. Totuși, simpla existență a acestor discuri nu înseamnă o protecție absolută. Problema este că procesul de recuperare (rebuild) este destul de muncitor și adesea de lungă durată. Efortul provine din accesul constant la datele principale. Asta înseamnă că sistemul, pe lângă munca curentă, trebuie să copieze datele pe un nou disc. Și durata rebuild-ului depinde direct de capacitatea unității de stocare și de caracteristicile sale de viteză. Deoarece sistemul nu știe nimic despre spațiul ocupat real pe discuri, în timpul rebuild-ului copiază pur și simplu totul: bloc cu bloc.
Ca urmare, recuperarea unui disc modern cu capacitate mare de 10+ TB în condiții de sarcină serioasă pe sistemul de stocare poate dura cu ușurință o săptămână sau mai mult. De asemenea, trebuie să aveți în vedere că, în timpul rebuild-ului, este semnificativ crescut riscul de defecțiune a altor unități din cauza creșterii sarcinii asupra lor. Acest lucru poate reprezenta o pericol serios în cazul utilizării, de exemplu, RAID5.
Ca soluție pentru această problemă, mulți dezvoltatori de sisteme de stocare s-au preocupat de accelerarea procesului de recuperare. Pentru aceasta pot fi aplicate diferite abordări, dar esența rămâne aceeași – copierea, în timpul rebuild-ului, doar a blocurilor realmente ocupate. De această problemă nu a lipsit nici Qsan. La sistemele de stocare ale acestui furnizor, cu opțiunea activată sistemul urmărește blocurile utilizate pentru scriere, având astfel capacitatea, în cazul unei defecțiuni a discului, de a copia doar acestea pe noua unitate.

Opțiunea Reconstruire Rapidă nu este activată în mod implicit la crearea de volume noi, deoarece utilizarea acesteia influențează performanța, în special în timpul operațiunilor de scriere aleatorie, din cauza:
- Este necesar să se efectueze urmărirea înregistrărilor în blocuri;
- La reconstruire, nu se face recalcularea sumelor de control pentru spațiul neutilizat, astfel că, pentru o nouă înregistrare în această zonă, este necesar mai întâi să o «inițializezi».
De aceea, nu este recomandat să se utilizeze Fast Rebuild pentru volume, de exemplu, cu baze de date foarte solicitate sau în sistemele de supraveghere video, unde volumul oricum va fi umplut în cele din urmă la 100%. Dar pentru serverele de fișiere sau de e-mail, această opțiune va fi deosebit de utilă.
În concluzie
Fiecare producător de stocare a datelor presupune că dispozitivele sale sunt fiabile. Și dacă nu există erori fatale în proiectarea dispozitivelor și o dorință incredibilă de economisire în procesul de producție și testare, atunci, în general, se poate fi de acord cu furnizorul. Totuși, trebuie să înțelegem:
- reziliența de bază a sistemului de stocare a datelor - este, înainte de toate, o modalitate de a continua accesarea datelor în cazul defectării oricărui component(e);
- opțiunile suplimentare în privința rezilienței (cum ar fi cele descrise mai sus) - exclud unele opțiuni de defectare și măresc șansele tale de a avea acces la date;
- 100% fiabilitate, din păcate, nu există. Dar, pentru a se apropia cât mai mult de aceasta, majoritatea furnizorilor de stocare a datelor rezonabili (și în rândul lor) depun maxim eforturi pentru a îmbunătăți continuu produsele lor atât în partea hardware, cât și în cea software.
De asemenea, nu trebuie uitat că nici o fiabilitate absolută a sistemului de stocare a datelor nu anulează necesitatea de copii de rezervă, planuri clare și exersate pentru recuperare în caz de disaster și suport tehnic operativ din partea furnizorului.
Sursa: habr.com
