Sortie du moteur de stockage TileDB 2.0

Publiée stockage TileDB 2.0, optimisé pour le stockage de tableaux multidimensionnels et de données utilisées dans les calculs scientifiques. Comme domaines d'application, TileDB mentionne divers systèmes de traitement d'informations génétiques, de données spatiales et financières, c'est-à-dire des systèmes qui opèrent sparse ou des tableaux multidimensionnels continuellement remplis. TileDB propose une bibliothèque C++ pour abstraire de manière transparente l'accès aux données et aux métadonnées dans les applications, prenant en charge tout le travail d'organisation de stockage efficace au niveau bas. Le code du projet est écrit en C++ et est distribué sous licence MIT. Il fonctionne sous Linux, macOS et Windows.

Les principales caractéristiques de TileDB :

  • Méthodes efficaces de stockage d'ensembles de données éparpillées, où les données ne suivent pas de manière continue, remplissant des fragments et où la majorité des éléments restent vides ou prennent la même valeur.
  • Accès aux données au format clé-valeur ou ensembles de colonnes (DataFrame);

    Sortie du moteur de stockage TileDB 2.0
  • Support de l'intégration avec les stockages cloud AWS S3, Google Cloud Storage et Azure Blob Storage ;
  • Prise en charge des tableaux en mosaïque (bloc) ;
  • Possibilité d'utiliser différents algorithmes de compression et de chiffrement des données ;
  • Support de la vérification de l'intégrité par des sommes de contrôle ;
  • Fonctionnement en mode multithread avec parallélisation des entrées/sorties ;
  • Prise en charge de la version des données stockées, y compris pour récupérer l'état à un moment donné dans le passé ou des mises à jour atomiques de grands ensembles dans leur intégralité.
  • Possibilité de lier des métadonnées ;
  • Support du regroupement des données ;
  • Modules d'intégration pour être utilisés comme moteur de stockage de bas niveau dans Spark, Dask, MariaDB, GDAL, PDAL, Rasterio, gVCF et PrestoDB ;
  • Bibliothèques de liaison sur l'API C++ pour les langages Python, R, Java et Go.

La version 2.0 se distingue par le support du concept de « DataFrame », qui permet de stocker des données sous forme de colonnes de valeurs de longueur variable, liées à des attributs spécifiques. Le stockage est également optimisé pour le traitement de matrices creuses de tailles hétérogènes (les cellules peuvent contenir des données de types différents et il est possible d'effectuer des opérations de fusion de colonnes de types différents, par exemple, celles qui contiennent le nom, le temps et le prix). Le support des colonnes avec des données textuelles a été ajouté. Des modules pour l'intégration avec Google Cloud Storage et Azure Blob Storage ont été ajoutés. L'API pour le langage R a été repensée.

Source : opennet.ru

Acheter un hébergement fiable pour les sites avec protection DDoS, serveurs VPS VDS 🔥 Acheter un hébergement fiable pour les sites avec protection DDoS, serveurs VPS VDS | ProHoster