Amazon heeft de overname van DuckLabs aangekondigd, dat de open database DuckDB ontwikkelt. Het overnameproces is op 31 augustus afgerond, de som van de deal wordt niet bekendgemaakt. Het team van ontwikkelaars van DuckDB voegt zich bij AWS en blijft werken aan DuckDB-technologieƫn onder leiding van de medeoprichters van DuckLabs.
De functionaliteiten van DuckDB zullen worden gebruikt voor het moderniseren, vereenvoudigen en verbeteren van de efficiƫntie van de analytische stack die wordt aangeboden op het AWS-platform. De Amazon S3-service is van plan om een opslagplaats te worden met ingebouwde mogelijkheden voor datanalyse. De codebasis van DuckDB zal blijven ontwikkelen als een open project, verspreid onder de MIT-licentie en beheerd door de non-profitorganisatie DuckDB Foundation. Het wordt opgemerkt dat de aansluiting bij AWS het gebruikerspubliek van DuckDB zal uitbreiden en extra middelen zal bieden voor het realiseren van nieuwe ideeƫn voor het schalen van de database.
De DuckDB-database lijkt conceptueel op SQLite en combineert eigenschappen zoals compactheid, een eenvoudig te integreren bibliotheek, opslag van databases in ƩƩn bestand en een CLI-interface, met mogelijkheden en optimalisaties voor het uitvoeren van analytische queries die een aanzienlijk deel van de opgeslagen gegevens dekken, zoals het uitvoeren van aggregatie van de volledige inhoud van tabellen of het samenvoegen van meerdere grote tabellen. De database ondersteunt een uitgebreide SQL-dialect, inclusief extra mogelijkheden voor het verwerken van complexe, langdurig uitgevoerde en geneste queries.
Het project maakt gebruik van een shell van SQLite, een parser van PostgreSQL, een Date Math-component van MonetDB, een eigen implementatie van venstervariabelen (gebaseerd op het Segment Tree Aggregation-algoritme), een reguliere expressie-verwerker op basis van de RE2-bibliotheek, een eigen query-optimalisator, een MVCC-mechanisme voor het beheer van gelijktijdige taakuitvoering (Multi-Version Concurrency Control), en ook een gevectoriseerde query-uitvoeringsengine op basis van het Hyper-Pipelining Query Execution-algoritme, waarmee grote sets waarden in ƩƩn operatie tegelijk kunnen worden verwerkt.
Bron: opennet.ru
