Veröffentlichung der Speicher-Engine TileDB 2.0

Veröffentlicht Speicher TileDB 2.0, optimiert für die Speicherung mehrdimensionaler Arrays und Daten, die in wissenschaftlichen Berechnungen verwendet werden. Zu den Anwendungsbereichen von TileDB gehören verschiedene Systeme zur Verarbeitung genetischer Informationen, räumlicher und finanzieller Daten, d.h. Systeme, die mit spärlichen oder kontinuierlich gefüllten mehrdimensionalen Arrays arbeiten. TileDB bietet eine C++-Bibliothek für die transparente Abstraktion des Zugriffs auf Daten und Metadaten in Anwendungen und übernimmt die gesamte Arbeit der niedrigstufigen Organisation einer effizienten Speicherung. Der Code des Projekts ist in C++ geschrieben und wird verbreitet unterliegt der MIT-Lizenz. Es wird die Arbeit unter Linux, macOS und Windows unterstützt.

Hauptmerkmale von TileDB:

  • Effiziente Methoden zur Speicherung von spärlichen Arrays, in denen die Daten nicht durchgängig sind, das Array mit Fragmenten gefüllt wird und der Großteil der Elemente leer bleibt oder denselben Wert annimmt.
  • Die Möglichkeit, auf Daten im Schlüssel-Wert-Format oder in Satzformen von Spalten zuzugreifen (DataFrame);

    Veröffentlichung der Speicher-Engine TileDB 2.0
  • Unterstützung der Integration mit Cloud-Speichern wie AWS S3, Google Cloud Storage und Azure Blob Storage;
  • Unterstützung für mosaikartige (blockartige) Arrays;
  • Die Möglichkeit, verschiedene Algorithmen zur Datenkompression und -verschlüsselung zu verwenden;
  • Unterstützung der Integritätsprüfung durch Prüfungschecks;
  • Betrieb im Multithread-Modus mit paralleler Eingabe/Ausgabe;
  • Unterstützung für die Versionierung der gespeicherten Daten, einschließlich der Abfrage des Zustands zu einem bestimmten Zeitpunkt in der Vergangenheit oder atomarer Aktualisierungen großer Mengen insgesamt.
  • Die Möglichkeit, Metadaten zu verknüpfen;
  • Unterstützung der Datenaggregation;
  • Integrationsmodule zur Verwendung als niedrigstufige Speicher-Engine in Spark, Dask, MariaDB, GDAL, PDAL, Rasterio, gVCF und PrestoDB;
  • Wrapper-Bibliotheken über die C++-API für die Sprachen Python, R, Java und Go.

Die Version 2.0 ist bemerkenswert durch die Unterstützung des Konzepts „DataFrame“, das es ermöglicht, Daten in Form von Werten in Spalten beliebiger Länge zu speichern, die an bestimmte Attribute gebunden sind. Der Speicher ist auch optimiert für die Verarbeitung von spärlichen Arrays unterschiedlicher Größe (in den Zellen können Daten unterschiedlicher Typen gespeichert werden und es können Merge-Operationen mit Spalten unterschiedlicher Typen durchgeführt werden, beispielsweise solche, die Titel, Zeit und Preis speichern). Unterstützung für Spalten mit String-Daten wurde hinzugefügt. Module für die Integration mit Google Cloud Storage und Azure Blob Storage wurden hinzugefügt. Die API für die Programmiersprache R wurde überarbeitet.

Quelle: opennet.ru

60GB SSD 8Gb DDR4