Le code du moteur SQL BlazingSQL, utilisant le GPU pour l'accélération, est maintenant ouvert

Annoncé ouverture du code source du moteur SQL BlazingSQL, utilisant le GPU pour accélérer le traitement des données. BlazingSQL n'est pas un véritable SGBD, mais se positionne comme un moteur d'analyse et de traitement de grands ensembles de données, comparable dans ses tùches à Apache Spark. Le code est écrit en Python et est ouvert sous licence Apache 2.0.

BlazingSQL est adaptĂ© pour exĂ©cuter des requĂȘtes analytiques uniques sur de grands ensembles de donnĂ©es (dizaines de gigaoctets), stockĂ©s dans des formats de tableau (par exemple, journaux, statistiques NetFlow, etc.). BlazingSQL peut exĂ©cuter des requĂȘtes Ă  partir de fichiers bruts dans des formats CSV et Apache Parquet, situĂ©s dans des systĂšmes de fichiers rĂ©seau et cloud, tels que HDFS et AWS S3, tout en transfĂ©rant directement le rĂ©sultat en mĂ©moire GPU. GrĂące au parallĂ©lisme des opĂ©rations sur le GPU et Ă  l'utilisation d'une mĂ©moire vidĂ©o plus rapide, les requĂȘtes dans BlazingSQL s'effectuent jusqu'Ă  20 fois plus rapidement qu'avec Apache Spark.

Le code du moteur SQL BlazingSQL, utilisant le GPU pour l'accélération, est maintenant ouvert

Pour travailler avec le GPU, un ensemble de bibliothÚques en développement en collaboration avec NVIDIA est utilisé, ouverts RAPIDS , permettant de créer des applications pour le traitement des données et l'analyse, exécutées entiÚrement cÎté GPU (uninterface Python est fourni pour utiliser les primitives bas niveau de CUDA et paralléliser les calculs). BlazingSQL permet d'utiliser SQL au lieu de l'API de traitement des données

cuUDF (basĂ© sur ), utilisĂ© dans RAPIDS. BlazingSQL est une couche supplĂ©mentaire qui fonctionne au-dessus de cuDF et utilise la bibliothĂšque cuIO pour lire les donnĂ©es depuis le disque. Les requĂȘtes SQL sont traduites en appels de fonctions cuUDF, permettant de charger des donnĂ©es dans le GPU et d'effectuer des opĂ©rations de fusion, d'agrĂ©gation et de filtrage. La crĂ©ation de configurations distribuĂ©es, couvrant des milliers de GPU, est prise en charge. Apache ArrowBlazingSQL simplifie considĂ©rablement le travail avec les donnĂ©es - au lieu de centaines d'appels de fonctions cuDF, un seul appel SQL peut suffire. L'utilisation de SQL permet d'assurer l'intĂ©gration de RAPIDS avec les systĂšmes analytiques existants, sans nĂ©cessiter d'Ă©crivains de traitement spĂ©cifiques ni de chargement intermĂ©diaire des donnĂ©es dans un SGBD supplĂ©mentaire, tout en

préservant la compatibilité totale avec toutes les parties de RAPIDS, en traduisant les fonctionnalités existantes en SQL et en garantissant des performances au niveau de cuDF. Cela inclut le support de l'intégration avec les bibliothÚques
XGBoost cuML et pour résoudre des problÚmes d'analyse et de machine learning. Annoncé l'ouverture du code source du moteur SQL

Source : opennet.ru

Acheter un hĂ©bergement fiable pour les sites avec protection DDoS, serveurs VPS VDS đŸ”„ Acheter un hĂ©bergement fiable pour les sites avec protection DDoS, serveurs VPS VDS | ProHoster