Situación: las GPU virtuales no son inferiores en rendimiento a las soluciones físicas

En febrero se llevó a cabo en Stanford una conferencia dedicada a la computación de alto rendimiento (HPC). Representantes de VMware informaron que al trabajar con GPU, el sistema basado en un hipervisor modificado ESXi no se queda atrás en velocidad comparado con soluciones bare metal.

Hablamos sobre las tecnologías que hicieron esto posible.

Situación: las GPU virtuales no son inferiores en rendimiento a las soluciones físicas
/ фото Victorgrigas CC BY-SA

Problema de rendimiento

Según estimaciones de analistas, alrededor del 70% de las cargas de trabajo en los centros de datos están virtualizadas. Sin embargo, el 30% restante sigue utilizándose en bare metal sin hipervisores. Este 30% está compuesto en su mayoría por aplicaciones de alta carga, relacionadas, por ejemplo, con el entrenamiento de redes neuronales, y que utilizan procesadores gráficos.

Los expertos explican esta tendencia por el hecho de que el hipervisor, como capa intermedia de abstracción, puede afectar el rendimiento de todo el sistema. En investigaciones de hace cinco años se pueden encontrar datos sobre una disminución de la velocidad de operación del 10%. Por lo tanto, las empresas y los operadores de centros de datos no se apresuran a trasladar las cargas HPC al entorno virtual.

Pero las tecnologías de virtualización están evolucionando y mejorando. En la conferencia hace un mes, VMware informó que el hipervisor ESXi no tiene un impacto negativo en el rendimiento de la GPU. La velocidad de cálculo puede disminuir en un tres por ciento, lo cual es comparable con las cifras de bare metal.

¿Cómo funciona?

Para aumentar el rendimiento de los sistemas HPC con procesadores gráficos, VMware realizó varias modificaciones en el hipervisor. En particular, lo liberaron de la función vMotion. Esta función es necesaria para balancear la carga y normalmente traslada máquinas virtuales (VM) entre servidores o GPU. Desactivar vMotion significó que ahora cada VM se asocia con un GPU específico. Esto ayudó a reducir los costos de intercambio de datos.

Otro componente clave del sistema es la tecnología DirectPath I/O. Esta permite que el controlador CUDA para cálculos paralelos interactúe directamente con las máquinas virtuales, eludiendo el hipervisor. Cuando se requiere ejecutar varias VMs en un solo GPU, se utiliza la solución GRID vGPU. Esta divide la memoria de la tarjeta en varios segmentos (pero los ciclos de cálculo no se dividen).

El esquema de trabajo de dos máquinas virtuales en este caso sería el siguiente:

Situación: las GPU virtuales no son inferiores en rendimiento a las soluciones físicas

Resultados y pronósticos

Empresa realizó pruebas hipervisor, entrenando un modelo de lenguaje basado en TensorFlow. La "pérdida" de rendimiento fue de solo un 3–4% en comparación con el bare metal. A cambio, el sistema obtuvo la capacidad de distribuir recursos según la demanda, dependiendo de las cargas actuales.

El gigante de TI también realizó pruebas con contenedores. Los ingenieros de la empresa entrenaron redes neuronales para reconocer imágenes. En este proceso, los recursos de una sola GPU se distribuyeron entre cuatro máquinas virtuales en contenedores. Como resultado, el rendimiento de cada máquina individual bajó un 17% (en comparación con una VM que tiene acceso completo a los recursos de la GPU). Sin embargo, la cantidad de imágenes procesadas por segundo aumentó tres veces. Se espera que sistemas como estos tengan aplicaciones en el análisis de datos y la modelización computacional.

Entre los problemas potenciales que podría enfrentar VMware, los expertos destacan una audiencia objetivo bastante limitada. Hasta ahora, solo un pequeño número de empresas trabaja con sistemas de alto rendimiento. Aunque en Statista se destaca, se señala que para 2021, ya se habrán virtualizado el 94% de las cargas de trabajo de los centros de datos globales. Según las previsiones de los analistas, el valor del mercado HPC crecerá de 32 a 45 mil millones de dólares entre 2017 y 2022.

Situación: las GPU virtuales no son inferiores en rendimiento a las soluciones físicas
/ фото Punto de Acceso Global PD

Soluciones similares

En el mercado hay varios análogos desarrollados por grandes empresas de TI: AMD e Intel.

La primera compañía se centra en la virtualización de gráficos ofrece con un enfoque basado en SR-IOV (virtualización de entrada/salida de raíz única). Esta tecnología proporciona a las VM acceso a parte de las capacidades de hardware del sistema. La solución permite dividir la GPU entre 16 usuarios manteniendo un rendimiento igual para las máquinas virtualizadas.

En cuanto al segundo gigante de TI, su tecnología se basa en el hipervisor Citrix XenServer 7. Combina el trabajo del controlador de GPU estándar y la máquina virtual, lo que permite a esta última mostrar aplicaciones 3D y escritorios en dispositivos de cientos de usuarios.

El futuro de la tecnología

Los desarrolladores de procesadores gráficos virtuales apuestan por la implementación de sistemas de IA y el aumento de la popularidad de soluciones de alto rendimiento en el mercado de la tecnología empresarial. Esperan que la necesidad de procesar grandes volúmenes de datos impulse la demanda de vGPU. Actualmente, los fabricantes

buscan formas buscan una manera combinar la funcionalidad de CPU y GPU en un solo núcleo para acelerar la resolución de tareas relacionadas con gráficos, la ejecución de cálculos matemáticos, operaciones lógicas y el procesamiento de datos. La aparición en el mercado de tales núcleos en el futuro cambiará el enfoque hacia la virtualización de recursos y su distribución entre cargas de trabajo en entornos virtuales y en la nube.

Lecturas recomendadas sobre el tema en nuestro blog corporativo:

Un par de publicaciones de nuestro canal de Telegram:

Fuente: habr.com

Compra un hosting fiable para sitios web con protección contra DDoS, servidores VPS VDS 🔥 Compra un hosting fiable para sitios web con protección contra DDoS, servidores VPS VDS | ProHoster