Situația: GPU-urile virtuale nu cedează în performanță față de soluțiile hardware

În februarie, la Stanford, a avut loc o conferință dedicată calculului de mare performanță (HPC). Reprezentanții VMware au explicat că, în cazul utilizării unităților GPU, sistemul bazat pe un hipervizor ESXi modificat nu este inferior soluțiilor bare metal ca viteză.

Discutăm despre tehnologiile care au permis realizarea acestui lucru.

Situația: GPU-urile virtuale nu cedează în performanță față de soluțiile hardware
/ фото Victorgrigas CC BY-SA

Problema performanței

Potrivit estimărilor analiștilor, aproximativ 70% din sarcinile de lucru din centrele de date sunt virtualizate. Cu toate acestea, cele 30% rămase funcționează încă pe bare metal fără hipervizoare. Aceste 30% sunt, în mare parte, formate din aplicații de mare încărcare, legate, de exemplu, de antrenarea rețelelor neuronale și care utilizează procesoare grafice.

Experții explică acest trend prin faptul că hipervizorul, ca strat intermediar de abstractizare, poate influența performanța întregului sistem. Studiile de acum cinci ani confirmă date privind scăderea rapidității operării cu 10%. Din acest motiv, companiile și operatorii de centre de date nu se grăbesc să migreze sarcinile HPC în medii virtualizate.

Dar tehnologiile de virtualizare evoluează și se perfecționează. La conferința de acum o lună, VMware a declarat că hipervizorul ESXi nu afectează negativ performanța GPU-urilor. Viteza de calcul poate scădea cu trei procente, ceea ce este comparabil cu rezultatele bare metal.

Cum funcționează

Pentru a îmbunătăți performanța sistemelor HPC cu GPU-uri, VMware a adus o serie de modificări hipervizorului. În special, acesta a fost eliberat de funcția vMotion. Aceasta este necesară pentru echilibrarea sarcinilor și, de obicei, mută mașinile virtuale (VM) între servere sau GPU-uri. Dezactivarea vMotion a dus la faptul că fiecare VM este acum asociată cu un GPU specific. Acest lucru a ajutat la reducerea costurilor de schimb de date.

Un alt component cheie al sistemului este tehnologia DirectPath I/O. Aceasta permite driverului CUDA pentru procesare paralelă să interacționeze direct cu mașinile virtuale, ocolind hipervizorul. Atunci când pe un GPU este necesar să se ruleze simultan mai multe VM-uri, se utilizează soluția GRID vGPU. Aceasta împarte memoria plăcii în mai multe segmente (dar ciclurile de calcul nu sunt împărțite).

Schema de funcționare a două mașini virtuale în acest caz va arăta astfel:

Situația: GPU-urile virtuale nu cedează în performanță față de soluțiile hardware

Rezultatele și prognozele

Compania au efectuat teste hypervisorului, antrenând un model lingvistic pe baza TensorFlow. „Daunele” de performanță au fost de doar 3-4% comparativ cu bare metal. În schimb, sistemul a obținut capacitatea de a distribui resurse în funcție de cerințele curente.

gigantul IT a efectuat teste cu containere. Inginerii companiei au instruit rețele neuronale să recunoască imagini. În acest context, resursele unei unități grafice au fost distribuite între patru VM-uri containerizate. Drept rezultat, performanța mașinilor individuale a scăzut cu 17% (comparativ cu o VM care avea acces complet la resursele GPU). Totuși, numărul imaginilor procesate pe secundă a crescut a crescut de trei ori. Se preconizează că astfel de sisteme vor găsi aplicare în domeniul analizei datelor și modelării computaționale.

Printre problemele potențiale cu care se poate confrunta VMware, experții evidențiază o audiență destul de restrânsă. Cu sistemele de înaltă performanță lucrează în prezent un număr redus de companii. Deși în Statista pun accent pe, se estimează că până în 2021, 94% din sarcinile de lucru ale centrelor de date globale vor fi virtualizate. Conform prognozelor analiștilor, valoarea pieței HPC va crește de la 32 la 45 miliarde de dolari în perioada 2017-2022.

Situația: GPU-urile virtuale nu cedează în performanță față de soluțiile hardware
/ фото Global Access Point PD

Soluții similare

Pe piață există câțiva analogi care sunt dezvoltați de mari companii IT: AMD și Intel.

Prima companie pentru virtualizarea unităților grafice oferă își bazează abordarea pe SR-IOV (virtualizarea intrării/ieșirii cu rădăcină unică). Această tehnologie oferă VM-urilor acces la o parte din capabilitățile hardware ale sistemului. Soluția permite împărțirea unității grafice între 16 utilizatori cu o performanță egală a sistemelor virtualizate.

În ceea ce privește al doilea gigant IT, tehnologia lor se bazează pe hypervisorul Citrix XenServer 7. Aceasta combină funcționarea driverului GPU standard și a mașinii virtuale, ceea ce permite ultimei să afișeze aplicații 3D și desktopuri pe dispozitivele sute de utilizatori.

Viitorul tehnologiei

Dezvoltatorii de unități grafice virtuale se bazează pe implementarea sistemelor de inteligență artificială și pe creșterea popularității soluțiilor de înaltă performanță pe piața tehnologiilor de afaceri. Ei speră că necesitatea procesării unor volume mari de date va crește cererea pentru vGPU.

În prezent, producătorii caută o modalitate combinarea funcționalităților CPU și GPU într-un singur nucleu pentru a accelera rezolvarea sarcinilor legate de grafică, efectuarea calculelor matematice, operațiunilor logice și procesarea datelor. Apariția pe piață a acestor nuclee în viitor va schimba abordarea virtualizării resurselor și distribuirea acestora între sarcinile de lucru în medii virtuale și cloud.

Ce să citești pe acest subiect în blogul nostru corporativ:

Câteva postări din canalul nostru Telegram:

Sursa: habr.com

Cumpără un hosting fiabil pentru site-uri cu protecție DDoS, servere VPS VDS 🔥 Cumpără un hosting fiabil pentru site-uri cu protecție DDoS, servere VPS VDS | ProHoster