Virtuaalmasinate jõudluse analüüs VMware vSphere'is. Osa 3: Salvestamine

Virtuaalmasinate jõudluse analüüs VMware vSphere'is. Osa 3: Salvestamine

Osa 1. CPU-st
Osa 2. Mälu

Täna vaatleme vSphere'i kettaaluste süsteemide mõõdikuid. Probleemid salvestusruumiga on kõige sagedamad põhjused, miks virtuaalne masin töötab aeglaselt. Kui CPU ja RAM-i tõrkeotsing lõpetatakse hüperviisoritasemel, siis ketta probleemidega võib osutuda vajalikuks vaadata ka andmeedastuse ja SAN-i poole.

Teemat käsitlen blokitaolise juurdepääsu näitel SAN-ile, kuigi failipõhise juurdepääsu korral on loendurid enam-vähem samad.

Veidi teooriat

Kui räägitakse virtuaalmasinate kettaaluste süsteemide jõudlustest, pööratakse tavaliselt tähelepanu kolmele omavahel seotud parameetrile:

  • sisendi/väljundi operatsioonide arv (Input/Output Operations Per Second, IOPS);
  • läbivool (Throughput);
  • sisendi/väljundi operatsioonide latentsus (Latency).

IOPS arvu on tavaliselt oluline juhuslike koormuste puhul: juurdepääs ketta plokkidele, mis asuvad erinevates kohtades. Näiteks võivad sellised koormused olla andmebaasid, äritarkvara (ERP, CRM) jne.

Läbivusvõime on oluline järjestikuste koormuste puhul: juurdepääs plokkidele, mis asuvad üksteise järel. Näiteks võivad selliseid koormusi genereerida failiserverid (kuid mitte alati) ja videovalvesüsteemid.

Läbivool on seotud sisendi/väljundi operatsioonide arvuga järgmiselt:

Throughput = IOPS * Bloki suurus, kus Bloki suurus on ploki suurus.

Ploki suurus on üsna oluline omadus. Praegused ESXi versioonid läbivad plokid, mille suurus on kuni 32 767 KB. Kui plokk on veel suurem, jagatakse see mitmele osale. Mitte kõik SAN-id ei suuda tõhusalt töötada nii suurte plokkidega, seetõttu on ESXi-l Hästi Seaded parameeter DiskMaxIOSize. Sellega saab vähendada hüperviisori poolt läbivat maksimaalset ploki suurust (lisaks siin). Soovitan enne selle parameetri muutmist konsulteerida SAN-i tootjaga või vähemalt katsetada muudatusi laboratoorses keskkonnas. 

Suure ploki suurus võib negatiivselt mõjutada SAN-i jõudlust. Isegi kui IOPS ja läbi voolu arv on suhteliselt madalad, võivad suure ploki korral esineda kõrged latentsused. Seetõttu pöörake sellele parameetrile tähelepanu.

Latency on kõige huvitavam jõudlusparameeter. Virtuaalse masina sisendi/väljundi operatsioonide latentsus koosneb:

  • latentsusest hüperviisorisse (KAVG, Average Kernel MilliSec/Read);
  • viivitused, mida pakuvad andmeedastusvõrk ja SAN (DAVG, keskmine draiveri millisekund/käsk).

Koguviiit, mida on näha külalise operatsioonisüsteemis (GAVG, keskmine külalise millisekund/käsk), on KAVG ja DAVG summa.

GAVG ja DAVG mõõdetakse, KAVG arvutatakse: GAVG–DAVG.

Virtuaalmasinate jõudluse analüüs VMware vSphere'is. Osa 3: Salvestamine
Allikas

Vaatame lähemalt KAVG. Normaalses töös peaks KAVG püüdma nulli või vähemalt olema palju väiksem kui DAVG. Ainus teadaolev juhtum, kus KAVG on ootuspäraselt kõrge, on VM ketta IOPS piirang. Sel juhul KAVG suureneb, kui üritate piiri ületada.

KAVG kõige olulisem koostisosa on QAVG – töötluse ooteaeg hüperviisoris. Ülejäänud KAVG komponendid on ebaolulised.

Kettaadapteri draiveris ja lunide järjekorrad on fikseeritud suurusega. Suure koormusega keskkondades on selles suuruses kasulik vajadusel suurendada. Siin Kirjeldatakse, kuidas suurendada adapteri draiveri järjekordi (samuti suureneb lunide järjekord). See seadistus töötab, kui luniga töötab ainult üks VM, mis on haruldane. Kui lunil on mitu VM-i, tuleb samuti suurendada parameetrit Disk.SchedNumReqOutstanding (juhis  siin). Järjekorra suurendamine vähendab QAVG-d ja KAVG-d vastavalt.

Kuid enne tehke tutvust tootja HBA dokumentatsiooniga ja testige muudatusi laboris.

Lunide järjekorra suurusele võib mõju avaldada SIOC (Storage I/O Control) mehhanismi sisselülitamine. See tagab ühtlase juurdepääsu lunile kõigi klastriserverite poolt, muutes dünaamiliselt lunide järjekorda serverites. See tähendab, et kui mõnes hostis töötab VM, mis nõuab proportsionaalselt suurt töötlemisvõimet (noisy neighbor VM), siis SIOC vähendab selle hosti lunide järjekorra pikkust (DQLEN). Rohkem teavet siin.

Oleme KAVG-st aru saanud, nüüd natuke DAVG. Siin on kõik lihtne: DAVG on viivitus, mille toob sisse väline keskkond (andmeedastusvõrk ja SAN). Igas kaasaegses ja vähem kaasaegses SAN-is on oma jõudluse loendurid. DAVG probleemide analüüsimiseks on mõistlik neid vaadata. Kui ESXi ja SAN-i pool on kõik korras, kontrollige andmeedastusvõrku.

Selleks, et vältida jõudlusprobleeme, valige oma salvestusruumi teede valimise poliitika (PSP) õigesti. Peaaegu kõik kaasaegsed salvestusruumid toetavad PSP Round-Robin (kas koos ALUA-ga, asümmeetrilise loogilise üksuse juurdepääsuga, või ilma). See poliitika võimaldab kasutada kõiki saadaval olevaid teid salvestusruumile. ALUA korral kasutatakse ainult teid kontrollile, mis omab LUN-i. Kõikidel salvestusruumidel ESXi-s ei pruugi olla vaikimisi reegleid, mis määravad Round-Robini poliitika. Kui teie salvestusruumi jaoks reeglit ei ole, kasutage salvestusruumi tootja pluginat, mis loob vastava reegli kõigi klastrihostide jaoks, või looge reegel ise. Üksikasjad siin

Samuti soovitavad mõned salvestusruumi tootjad muuta IOPS-i arvu teel vaikesättest 1000-1. Meie praktikas on see võimaldanud salvestusruumilt rohkem jõudlust "välja pigistada" ning oluliselt vähendada aega, mis on vajalik rikkest taastumiseks või kontrollide uuendamiseks. Kontrollige tootja soovitusi ja kui vastunäidustusi pole, proovige seda parameetrit muuta. Üksikasjad siin.

Virtuaalse masina kettasüsteemi peamised jõudluse näitajad

vCenteris kogutud kettasüsteemi jõudluse näitajad on jagatud jaotistele Datastore, Disk, Virtual Disk:

Virtuaalmasinate jõudluse analüüs VMware vSphere'is. Osa 3: Salvestamine

Jaotises Datastore sisaldavad vSphere (datastore) kettahoidlate meetrikaid, kus paiknevad VM-i kettad. Siit leiate standardseid näitajaid:

  • IOPS-i (keskmised lugemis-/kirjutamise päringud sekundis), 
  • läbivoolu (lugemise/kirjutamise kiirus), 
  • latentsuse (lugemise/kirjutamise/kõrgeim latentsus).

Nimekirjadest on põhimõtteliselt kõik arusaadav. Kordan veel, et siin statistika ei kehti konkreetse VM-i (või VM-i kettad) kohta, vaid on üldine kogu datastore'i kohta. Minu arvates on seda statistikat mugavam vaadata ESXTOP-is, arvestades, et seal on minimaalne mõõtmise aeg 2 sekundit.

Jaotises Ketas sisaldavad blokkseadmestike metrikaid, mida VM kasutab. Siin on näitajad IOPS-i tüübi summatsioon (sisend-/väljundoperatsioonide arv mõõtmise perioodi jooksul) ja mitmeid näitajaid, mis on seotud plokkjuurdepääsuga (Commands aborted, Bus resets). Minu arvates on ka seda teavet mugavam vaadata ESXTOP-is.

Jaotis Virtuaalne ketas – kõige kasulikum tööriist, et tuvastada virtuaalmasina ketasüsteemi jõudlusprobleeme. Siit on võimalik vaadata jõudlust iga virtuaalse ketta lõikes. Just seda teavet on vaja, et mõista, kas konkreetse virtuaalmasinaga on probleem. Lisaks standardsetele sisenemise/sisenemisoperatsioonide, lugemise/kirjutamise mahu ja latentsuse mõõdikutele on sellesse jao lisatud ka kasulikud mõõdikud, mis näitavad ploki suurust: lugemise/kirjutamise päringu suurus.

Alloleval pildil on virtuaalmasina ketta jõudluse graafik, kus on näha IOPS, latentsus ja ploki suurus. 

Virtuaalmasinate jõudluse analüüs VMware vSphere'is. Osa 3: Salvestamine

Kuna SIOC on sisse lülitatud, saab jõudlusmõõdikuid vaadata ka kogu andmehoidlas. Siin on esitatud põhiteave keskmise latentsuse ja IOPS-ide kohta. Vaikimisi saab seda teavet vaadata ainult reaalajas.

Virtuaalmasinate jõudluse analüüs VMware vSphere'is. Osa 3: Salvestamine

ESXTOP

ESXTOP-is on mitu ekraani, mis näitavad hosti ketasüsteemi, eraldi virtuaalmasinate ja nende ketaste teavet.

Alustame virtuaalmasinate teabest. Ekraani "Disk VM" avatakse klahvi "v" abil:

Virtuaalmasinate jõudluse analüüs VMware vSphere'is. Osa 3: Salvestamine

NVDISK – see on virtuaalmasinate kettaste arv. Iga ketta teabe vaatamiseks vajutage "e" ja sisestage huvipakkuva virtuaalmasina GID.

Ülejäänud parameetrite tähendused selles ekraanil on selged nende nimedest.

Veel üks kasulik ekraan probleemide tuvastamiseks on Disk adapter. See avatakse klahvi "d" abil (alloleval pildil on valitud väljad A, B, C, D, E, G):

Virtuaalmasinate jõudluse analüüs VMware vSphere'is. Osa 3: Salvestamine

NPTH – nähtavate teede arv lunadele, mis on nähtavad antud adapterilt. Iga tee teabe saamiseks adapteril vajutage "e" ja sisestage adapteri nimi:

Virtuaalmasinate jõudluse analüüs VMware vSphere'is. Osa 3: Salvestamine

AQLEN – maksimaalne järjekorra suurus adapteril.

Samuti on selles ekraanil esitatud latentsuse mõõdikud, millest ma eespool rääkisin: KAVG/cmd, GAVG/cmd, DAVG/cmd, QAVG/cmd.

Disk device ekraanil, mille avamine käib klahvi "u" abil, on esitatud andmed eraldiseisvate plokkseadmete – lunade (alloleval pildil on valitud väljad A, B, F, G, I) kohta. Siit on võimalik näha lunade järjekorra olekut.

Virtuaalmasinate jõudluse analüüs VMware vSphere'is. Osa 3: Salvestamine

DQLEN – plokkseadmest tulev järjekorra suurus.
ACTV – andmeedastusoperatsioonide arv ESXi tuumas.
QUED – järjekorras olevate andmeedastusoperatsioonide arv.
%USD – ACTV / DQLEN × 100%.
LOAD – (ACTV + QUED) / DQLEN.

Kui %USD on kõrge, tuleks kaaluda järjekorra suurendamise võimalust. Mida rohkem käske on järjekorras, seda kõrgem on QAVG ja seega ka KAVG.

Samuti saab Disk device ekraanilt vaadata, kas VAAI (vStorage API for Array Integration) töötab SCSI-l. Selleks tuleb valida väljad A ja O.

VAAI mehhanism võimaldab osa tööst viia hüperviisoritelt otse SCSI-le, näiteks nullimine, plokkide kopeerimine või lukustamine.

Virtuaalmasinate jõudluse analüüs VMware vSphere'is. Osa 3: Salvestamine

Nagu ülaltoodud pildilt näha, töötab antud SCSI-l VAAI: aktiivselt kasutatakse Zero ja ATS primitiive.

Soovitused diskialt süsteemi optimeerimiseks ESXi-l

  • Pöörake tähelepanu ploki suurusele.
  • Seadke HBA jaoks optimaalne järjekorra suurus.
  • Ärge unustage aktiveerida SIOC andmestoodetes.
  • Valige PSP vastavalt SCSI tootja soovitustele.
  • Veenduge, et VAAI töötab.

Kasulikud artiklid teema kohta:http://www.yellow-bricks.com/2011/06/23/disk-schednumreqoutstanding-the-story/
http://www.yellow-bricks.com/2009/09/29/whats-that-alua-exactly/
http://www.yellow-bricks.com/2019/03/05/dqlen-changes-what-is-going-on/
https://www.codyhosterman.com/2017/02/understanding-vmware-esxi-queuing-and-the-flasharray/
https://www.codyhosterman.com/2018/03/what-is-the-latency-stat-qavg/
https://kb.vmware.com/s/article/1267
https://kb.vmware.com/s/article/1268
https://kb.vmware.com/s/article/1027901
https://kb.vmware.com/s/article/2069356
https://kb.vmware.com/s/article/2053628
https://kb.vmware.com/s/article/1003469
https://www.vmware.com/content/dam/digitalmarketing/vmware/en/pdf/techpaper/performance/vsphere-esxi-vcenter-server-67-performance-best-practices.pdf

Allikas: habr.com

Osta usaldusväärne hostimine veebilehtede jaoks DDoS-i kaitsega, VPS VDS serverid 🔥 Osta usaldusväärne hostimine veebilehtede jaoks DDoS-i kaitsega, VPS VDS serverid | ProHoster