ouverture du code source du moteur SQL , utilisant le GPU pour accélérer le traitement des données. BlazingSQL n'est pas un véritable SGBD, mais se positionne comme un moteur d'analyse et de traitement de grands ensembles de données, comparable dans ses tùches à . Le code est écrit en Python et sous licence Apache 2.0.
BlazingSQL est adaptĂ© pour exĂ©cuter des requĂȘtes analytiques uniques sur de grands ensembles de donnĂ©es (dizaines de gigaoctets), stockĂ©s dans des formats de tableau (par exemple, journaux, statistiques NetFlow, etc.). BlazingSQL peut exĂ©cuter des requĂȘtes Ă partir de fichiers bruts dans des formats CSV et Apache Parquet, situĂ©s dans des systĂšmes de fichiers rĂ©seau et cloud, tels que HDFS et AWS S3, tout en transfĂ©rant directement le rĂ©sultat en mĂ©moire GPU. GrĂące au parallĂ©lisme des opĂ©rations sur le GPU et Ă l'utilisation d'une mĂ©moire vidĂ©o plus rapide, les requĂȘtes dans BlazingSQL s'effectuent jusqu'Ă plus rapidement qu'avec Apache Spark.
Pour travailler avec le GPU, un ensemble de bibliothÚques en développement en collaboration avec NVIDIA est utilisé, RAPIDS interface Python BlazingSQL permet d'utiliser SQL au lieu de l'API de traitement des données
cuUDF ), utilisĂ© dans RAPIDS. BlazingSQL est une couche supplĂ©mentaire qui fonctionne au-dessus de cuDF et utilise la bibliothĂšque cuIO pour lire les donnĂ©es depuis le disque. Les requĂȘtes SQL sont traduites en appels de fonctions cuUDF, permettant de charger des donnĂ©es dans le GPU et d'effectuer des opĂ©rations de fusion, d'agrĂ©gation et de filtrage. La crĂ©ation de configurations distribuĂ©es, couvrant des milliers de GPU, est prise en charge. BlazingSQL simplifie considĂ©rablement le travail avec les donnĂ©es - au lieu de centaines d'appels de fonctions cuDF, un seul appel SQL peut suffire. L'utilisation de SQL permet d'assurer l'intĂ©gration de RAPIDS avec les systĂšmes analytiques existants, sans nĂ©cessiter d'Ă©crivains de traitement spĂ©cifiques ni de chargement intermĂ©diaire des donnĂ©es dans un SGBD supplĂ©mentaire, tout en
préservant la compatibilité totale avec toutes les parties de RAPIDS, en traduisant les fonctionnalités existantes en SQL et en garantissant des performances au niveau de cuDF. Cela inclut le support de l'intégration avec les bibliothÚques
XGBoost et Annoncé l'ouverture du code source du moteur SQL
Source : opennet.ru
