sobre la apertura del código fuente del motor SQL , que utiliza GPU para acelerar el procesamiento de datos. BlazingSQL no es un sistema de gestión de bases de datos (SGBD) completo, sino que se presenta como un motor para el análisis y procesamiento de grandes conjuntos de datos, comparable en sus tareas con . El código está escrito en Python y bajo la licencia Apache 2.0.
BlazingSQL es adecuado para realizar consultas analíticas únicas sobre grandes conjuntos de datos (decenas de gigabytes), almacenados en formatos tabulares (por ejemplo, registros, estadísticas de NetFlow, etc.). BlazingSQL puede ejecutar consultas desde archivos raw en formatos CSV y Apache Parquet, ubicados en sistemas de archivos de red y en la nube, como HDFS y AWS S3, pasando directamente el resultado a la memoria de la GPU. Gracias a la paralelización de operaciones en la GPU y al uso de una memoria de video más rápida, la ejecución de consultas en BlazingSQL se realiza hasta más rápida que en Apache Spark.
Para trabajar con GPU, se utiliza un conjunto de bibliotecas en desarrollo con la participación de NVIDIA RAPIDS una interfaz de Python BlazingSQL brinda la posibilidad de usar SQL en lugar de la API de procesamiento de datos
cuUDF (basado en BlazingSQL simplifica enormemente el trabajo con datos: en lugar de cientos de llamadas a funciones cuDF, se puede utilizar una única consulta SQL. El uso de SQL permite la integración de RAPIDS con sistemas de análisis existentes, sin la necesidad de escribir controladores específicos y sin recurrir a la carga intermedia de datos en un SGBD adicional, mientras que
se mantiene la plena compatibilidad con todas las partes de RAPIDS, traduciendo la funcionalidad existente a SQL y asegurando un rendimiento a nivel de cuDF. También se ha asegurado el soporte para la integración con bibliotecas
cuML y Se anunció la apertura del código fuente del motor SQL
Fuente: opennet.ru
