Reagimi i katastrofave në cloud: si funksionon

Përshëndetje, Habr!

Pas festave të Vitit të Ri, ripërtëritëm cloud-in e qëndrueshëm ndaj katastrofave në dy lokacione. Sot do të tregojmë se si është strukturuar kjo dhe do të ilustrojmë se çfarë ndodh me makinat virtuale të klientëve kur ndodhin dështime në disa komponente të klasterit dhe kur një lokacion tërheqhet (spoiler – ato vazhdojnë të funksionojnë normalisht).

Reagimi i katastrofave në cloud: si funksionon
Sistemi i ruajtjes së të dhënave në cloud-in e qëndrueshëm ndaj katastrofave në lokacionin OST.

Çfarë ka brenda

Nën kapuçin e klasterit janë serverët Cisco UCS me hipervizorin VMware ESXi, dy sisteme ruajtjeje INFINIDAT InfiniBox F2240, pajisje rrjetesh Cisco Nexus, si dhe switch-a SAN Brocade. Klasteri është shpërndarë në dy lokacione – OST dhe NORD, që do të thotë se në çdo qendër të të dhënave është set i njëjtë pajisjesh. Kjo është ajo që e bën atë të qëndrueshëm ndaj katastrofave.

Në kuadër të një lokacioni, elementet kryesore janë gjithashtu të dyfishuara (host-at, switch-at SAN, rrjetet).
Dy lokacione janë të lidhura me linja optike të dedikuara, gjithashtu të rezervuara.

Pak fjalë për sistemet e ruajtjes. Versioni i parë i cloud-it të qëndrueshëm ndaj katastrofave e ndërtuam në NetApp. Këtu zgjodhëm INFINIDAT, dhe ja pse:

  • Opsioni i replikimit Active-Active. Ky opsion lejon që makina virtuale të qëndrojë në gjendje funksionimi edhe në rastin e dështimit të plotë të njërit nga sistemet e ruajtjes. Në vazhdim do flas më shumë për replikimin.
  • Tre kontrolerë disku për të rritur qëndrueshmërinë e sistemit. Zakonisht ka vetëm dy.
  • Zgjidhje e gatshme. Një raft i mbledhur erdhi tek ne, që vetëm duhet ta lidhim me rrjetin dhe ta konfigurojmë.
  • Përkrahje teknike e kujdesshme. Inxhinierët e INFINIDAT analizojnë vazhdimisht log-et dhe ngjarjet e sistemit të ruajtjes, instalojnë versionet e reja në firmware, ndihmojnë me konfigurimin.

Ja disa foto nga unpacking:

Reagimi i katastrofave në cloud: si funksionon

Reagimi i katastrofave në cloud: si funksionon

Si funksionon

Cloud-i tashmë është i qëndrueshëm brenda vetes. Ai mbron klientin nga dështimet individuale të pajisjeve dhe softuerit. Ndërsa, qëndrueshmëria ndaj katastrofave ndihmon për t’u mbrojtur nga dështimet masive brenda një lokacioni: për shembull, dështimi i sistemit të ruajtjes (ose i klasterit SDS, që ndodh shpesh 🙂), gabime masive në rrjetin e ruajtjes dhe të tjera. Dhe gjëja kryesore: një cloud i tillë shpëton kur një lokacion i tëri bëhet i paarritshëm për shkak të një zjarri, një tërheqjeje energjie, grabitje të dhunshme, ose një sulmi të alienëve.

Në të gjitha këto raste, makinat virtuale të klientëve vazhdojnë të funksionojnë, dhe ja pse.

Skema e klasterit është e dizajnuar në mënyrë që çdo host ESXi me makina virtuale të klientëve të mund të aksesojë çdo sistem ruajtjeje nga dy lokacionet. Nëse sistemi i ruajtjes në lokacionin OST dështon, atëherë makinat virtuale do të vazhdojnë të funksionojnë: hostet, në të cilat ato punojnë, do të kërkojnë të dhëna nga sistemi i ruajtjes në NORD.

Reagimi i katastrofave në cloud: si funksionon
Kështu duket skema e lidhjes në klaster.

Kjo është e mundur për shkak se midis fabrikave SAN të dy lokacioneve është përcaktuar Inter-Switch Link: switch-i SAN Fabric A OST është lidhur me switch-in SAN Fabric A NORD, ashtu si edhe për switch-at SAN Fabric B.

Dhe që të gjitha këto ndërthurrje të fabrikave SAN të kenë kuptim, midis dy sistemeve të ruajtjes është përcaktuar replikimi Active-Active: informacioni regjistrohet pothuajse njëkohësisht në sistemin e ruajtjes lokal dhe atë të largët, RPO=0. Pra, në një sistem ruajtjeje ruhet origjinali i të dhënave, ndërsa në tjetrin – replikimi i tyre. Të dhënat replikohen në nivelin e volumeve të sistemit të ruajtjes, dhe aty ruhen të dhënat e VM (disqet e saj, skedari i konfigurimit, skedari swap etj.).

Hosti ESXi e sheh volumin kryesor dhe replikimin e tij si një pajisje të vetme ruajtjeje (Storage Device). Nga hosti ESXi në çdo pajisje ruajtjeje ka 24 rrugë:

12 rrugë lidhin atë me sistemin e ruajtjes lokal (rrugët optimale), ndërsa të tjerat 12 – me atë të largët (rrugët jo optimale). Në një situatë normale, ESXi akseson të dhënat në sistemin e ruajtjes lokal, duke përdorur "rrugët optimale". Në rast se ky sistem dështoi, ESXi humbet rrugët optimale dhe kalon në "rrugët jo optimale". Kështu duket në skemë.

Reagimi i katastrofave në cloud: si funksionon
Skema e klasterit të qëndrueshëm ndaj katastrofave.

Të gjitha rrjetet e klientëve janë të lidhura me të dy lokacionet përmes një fabrikë rrjeti të përbashkët. Në çdo lokacion funksionon Provider Edge (PE), ku mbarojnë rrjetet e klientëve. PE janë të lidhura në një klaster të përbashkët. Në rast të dështimit të PE në një lokacion, e gjithë trafiku ridrejtohet në lokacionin e dytë. Falë kësaj, makinat virtuale nga lokacioni që ka humbur PE mbeten të aksesueshme në rrjet për klientin.

Tani le të shikojmë se çfarë do të ndodhë me makinat virtuale të klientit në rastet e ndryshme të dështimeve. Le të fillojmë me variantet më të lehta dhe të përfundojmë me dështimin më serioz – dështimin e tërë lokacionit. Në shembuj, lokacioni kryesor do të jetë OST, dhe lokacioni rezervë, me replikat e të dhënave, do të jetë NORD.

Çfarë ndodh me makinën virtuale të klientit, nëse…

Dështimi i Replication Link. Replikimi midis sistemeve të ruajtjes në të dy lokacionet ndërpritet.
ESXi do të punojë vetëm me pajisjet e diskut lokale (përmes rrugëve optimale).
Makinat virtuale vazhdojnë të funksionojnë.

Reagimi i katastrofave në cloud: si funksionon

Ka një ndërprerje ISL (Inter-Switch Link). Një rast i paevendtë. Ndryshe nga ndonjë ekskavator i çmendur që mund të shkatërrojë disa linja optike që kalojnë në rrugë të pavarura dhe janë të lidhura me vendet përmes hyrjeve të ndryshme. Megjithatë. Në këtë rast, hostet ESXi humbin gjysmën e rrugëve dhe mund të kenë qasje vetëm në SAN-të e tyre lokale. Replikat krijohen, por hostet nuk mund t'i aksesojnë ato.

Makinat virtuale punojnë normalisht.

Reagimi i katastrofave në cloud: si funksionon

Dështimi i switch-it SAN në një nga vendet. Hostet ESXi humbin një pjesë të rrugëve drejt SAN-it. Në këtë rast, hostet në vendin ku ka ndodhur dështimi i switch-it, do të punojnë vetëm përmes një HBA të vet.

Makinat virtuale vazhdojnë të punojnë normalisht.

Reagimi i katastrofave në cloud: si funksionon

Të gjitha switch-et SAN dështojnë në një nga vendet. Le të themi, ndodhi një e keqe në vendin OST. Në këtë rast, hostet ESXi në këtë vend do të humbin të gjitha rrugët drejt pajisjeve të tyre disk. Mekanizmi standard i VMware vSphere HA hyn në funksion: ai do të ri-ngrejë të gjitha makinat virtuale në vendin OST në NORD brenda 140 sekondave maksimalisht.

Makinat virtuale që punojnë në hostet e vendit NORD, punojnë normalisht.

Reagimi i katastrofave në cloud: si funksionon

Një host ESXi dështojnë në një vend. Këtu gjithashtu aktivizohet mekanizmi vSphere HA: makinat virtuale nga hosti që ka dështuar ri-ngrihen në hostet e tjera - në të njëjtin apo në një vend të largët. Koha për ri-ngritjen e makines virtuale është deri në 1 minutë.

Nëse të gjitha hostet ESXi në vendin OST dështojnë, atëherë nuk ka mundësi tjetër: VM-të ri-ngrihen në një tjetër. Koha e ri-ngritjes është e njëjtë.

Reagimi i katastrofave në cloud: si funksionon

Dështimi i SAN-it në një vend. Le të themi, dështoi SAN-i në vendin OST. Në këtë rast, hostet ESXi të vendit OST kalojnë në punën me replikat e SAN-it në NORD. Pas përmirësimit të SAN-it të dështuar do të ndodhë një replikim i detyruar, dhe hostet ESXi OST do të fillojnë përsëri të kenë qasje në SAN-in lokal.

Makinat virtuale gjatë gjithë kësaj kohe punojnë normalisht.

Reagimi i katastrofave në cloud: si funksionon

Një nga vendet dështojnë. Në këtë rast, të gjitha makinat virtuale do të ri-ngrihen në vendin rezervë përmes mekanizmit vSphere HA. Koha e ri-ngritjes së VM është 140 sekonda. Gjatë kësaj, të gjitha cilësimet rrjetore të makinës virtuale do të ruhen, dhe ajo do të mbetet e qasshme për klientin përmes rrjetit.

Për të siguruar që ri-ngritja e makinave në vendin rezervë të kalojë pa probleme, çdo vend është i mbushur vetëm gjysmë. Gjysma tjetër është rezervë për rastin e kalimit të të gjitha makinave virtuale nga vendi të dytë, i dëmtuar.

Reagimi i katastrofave në cloud: si funksionon

Pikërisht nga këto dështime e mbron Cloud-i i qëndrueshëm ndaj katastrofave në bazë të dy qendrave të të dhënave.

Kjo është një kënaqësi e kushtueshme, pasi përveç burimeve kryesore, kërkohet një rezervë në vendin e dytë. Prandaj, kjo lloj cloud-i vendoset për shërbime kritike për biznesin, ku ndalimi i gjatë sjell humbje të mëdha financiare dhe reputacionale, ose kur sistemi informativ ka kërkesa për qëndrueshmëri ndaj katastrofave nga rregullatorët ose rregulloret e brendshme të kompanisë.

Burimet:

  1. www.infinidat.com/sites/default/files/resource-pdfs/DS-INFBOX-190331-US_0.pdf
  2. support.infinidat.com/hc/en-us/articles/207057109-InfiniBox-best-practices-guides

Burimi: habr.com

Bleni hostim të besueshëm për faqe me mbrojtje nga DDoS, serverë VPS VDS 🔥 Bleni hostim të besueshëm për faqe me mbrojtje nga DDoS, serverë VPS VDS | ProHoster