stocare , optimizat pentru stocarea array-urilor multidimensionale și a datelor utilizate în calcule științifice. Printre domeniile de aplicare ale TileDB se numără diferite sisteme de procesare a informațiilor genetice, a datelor spațiale și financiare, adică sisteme care operează sau array-uri multidimensionale completibile continuu. TileDB oferă o bibliotecă C++ pentru abstracția transparentă a accesului la date și metadate în aplicații, preluând întreaga muncă de organizare la nivel scăzut a stocării eficiente. Codul proiectului este scris în C++ și sub licență MIT. Suportă funcționarea pe Linux, macOS și Windows.
Caracteristici principale ale TileDB:
- Metode eficiente de stocare a array-urilor sparse, datele în care nu urmează continuu, array-ul se umple în fragmente și cea mai mare parte a elementelor rămâne goală sau are aceeași valoare.
- Posibilitatea de acces la date în format cheie-valoare sau seturi de coloane ();
- Suport pentru integrarea cu servicii de stocare în cloud precum AWS S3, Google Cloud Storage și Azure Blob Storage;
- Suport pentru array-uri mozaicale (blocuri);
- Posibilitatea de a utiliza diferite algoritmi de compresie și criptare a datelor;
- Suport pentru verificarea integrității prin checksum-uri;
- Funcționare în mod multithreading cu paralelizare pentru intrare/ieșire;
- Suport pentru versionarea datelor stocate, inclusiv pentru extragerea stării la un moment dat în trecut sau actualizări atomice ale întregilor seturi mari.
- Posibilitatea de a vincula metadate;
- Suport pentru gruparea datelor;
- Module de integrare pentru utilizarea ca motor de stocare la nivel scăzut în Spark, Dask, MariaDB, GDAL, PDAL, Rasterio, gVCF și PrestoDB;
- Biblioteci de lungime deasupra API-ului C++ pentru limbajele Python, R, Java și Go.
Lansarea 2.0 se remarcă prin suportul pentru conceptul de „DataFrame”, care permite stocarea datelor sub formă de coloane de valori de lungime arbitrară, legate de atribute specifice. Stocarea este de asemenea optimizată pentru procesarea array-urilor sparse de dimensiuni heterogene (în celule pot fi stocate date de tipuri diferite și se pot efectua operațiuni de combinare a coloanelor de tipuri diferite, de exemplu, în care se stochează denumiri, timp și preț). A fost adăugat suport pentru coloane cu date de tip string. Au fost adăugate module pentru integrarea cu Google Cloud Storage și Azure Blob Storage. API-ul pentru limbajul R a fost reproiectat.
Sursa: opennet.ro
