Uitgave van opslagengine TileDB 2.0

Gepubliceerd opslag TileDB 2.0, geoptimaliseerd voor het opslaan van multidimensionale arrays en gegevens die worden gebruikt in wetenschappelijke berekeningen. Toepassingen van TileDB omvatten verschillende systemen voor het verwerken van genetische informatie, ruimtelijke en financiƫle gegevens, dat wil zeggen systemen die omgaan met spaarzame of continu opgeloste multidimensionale arrays. TileDB biedt een C++ bibliotheek voor transparante abstractie van gegevens- en metadata-toegang in applicaties, en neemt de hele last van laagniveau-organisatie van efficiƫnt opslaan op zich. De projectcode is geschreven in C++ en wordt verspreid onder MIT-licentie. Ondersteunt werking op Linux, macOS en Windows.

Belangrijkste kenmerken van TileDB:

  • EfficiĆ«nte opslagmethoden voor spaarzame arrays, waarbij gegevens niet continu volgen, de array wordt gevuld met fragmenten en de meeste elementen leeg blijven of dezelfde waarde aannemen.
  • Toegang tot gegevens in sleutel-waarde of kolomsets formaat (DataFrame);

    Uitgave van opslagengine TileDB 2.0
  • Ondersteuning voor integratie met cloudopslagdiensten zoals AWS S3, Google Cloud Storage en Azure Blob Storage;
  • Ondersteuning voor mozaĆÆek (block) arrays;
  • Mogelijkheid om verschillende compressie- en encryptie-algoritmen te gebruiken;
  • Ondersteuning voor integriteitscontroles met checksums;
  • Werken in een multithreaded modus met parallelle invoer/uitvoer;
  • Ondersteuning voor versiebeheer van opgeslagen gegevens, inclusief het opvragen van de status op een bepaald moment in het verleden of atomische updates van grote datasets.
  • Mogelijkheid om metadata te koppelen;
  • Ondersteuning voor gegevensgroepering;
  • Integratiemodules voor gebruik als laag-niveau opslagmotor in Spark, Dask, MariaDB, GDAL, PDAL, Rasterio, gVCF en PrestoDB;
  • Wrapper-bibliotheken bovenop de C++ API voor de talen Python, R, Java en Go.

Versie 2.0 is opmerkelijk voor de ondersteuning van het concept "DataFrame", dat het mogelijk maakt om gegevens op te slaan in de vorm van kolommen met waarden van wisselende lengte, gekoppeld aan specifieke attributen. De opslag is ook geoptimaliseerd voor het verwerken van spaarzame arrays van verschillende groottes (in cellen kunnen gegevens van verschillende types worden opgeslagen en het is mogelijk om operaties voor kolomfusies van verschillende types uit te voeren, bijvoorbeeld waarin namen, tijd en prijs worden opgeslagen). Ondersteuning voor kolommen met stringgegevens is toegevoegd. Modules voor integratie met Google Cloud Storage en Azure Blob Storage zijn toegevoegd. De API voor de taal R is herwerkt.

Bron: opennet.ru

Koop betrouwbare webhosting met bescherming tegen DDoS, VPS VDS servers šŸ”„ Koop betrouwbare webhosting met bescherming tegen DDoS, VPS VDS servers | ProHoster