De release van de gedistribueerde database Apache Cloudberry 2.0.0 is gepresenteerd, die de ontwikkeling van de open-source codebasis van de Greenplum-database voortzet, die door Broadcom na de overname van VMware in een gesloten product is veranderd. Apache Cloudberry 2.0.0 wordt gemarkeerd als de eerste release van het project, na de overdracht van de code naar de Apache-gemeenschap. Het project bevindt zich momenteel in de Apache-incubator en zal worden omgevormd tot een van de primaire Apache-projecten zodra de infrastructuur en ondersteuningen gereed zijn.
De Cloudberry-database is een gedistribueerde editie van de open source PostgreSQL-database, geoptimaliseerd voor het uitvoeren van analytische queries op grote datasets (Data Warehouse). Voor parallelle gegevensverwerking wordt een massaal parallelle architectuur (MPP, massively parallel processing) toegepast, die schaalbaarheid van de opslag tot petabyte-niveaus mogelijk maakt door gegevens in segmenten te splitsen en een cluster van een groep te gebruiken voor opslag en verwerking. servers.
Onder de verbeteringen in Apache Cloudberry 2.0.0:
- De overstap naar de PostgreSQL 14-codebasis is gerealiseerd (Greenplum was gebaseerd op PostgreSQL 12).
- Ondersteuning voor dynamische tabellen is toegevoegd, waardoor het mogelijk is om de resultaten van queries automatisch bij te werken. Deze nieuwe functie is nuttig als het nodig is om met actuele gegevens te werken, bijvoorbeeld voor realtime data-analyse, Lakehouse-architecturen en geautomatiseerde ETL-processen (Extract, Transform, Load).
- Er is een nieuw hybride opslagformaat PAX (Partition Attributes Across) geĆÆmplementeerd, dat de mogelijkheden van rij-gebaseerde en kolom-gebaseerde opslag combineert. Het PAX-formaat maakt hoge prestaties mogelijk bij zowel hoge schrijfdruk als bij het uitvoeren van analytische queries.
- De planning en uitvoering van gedistribueerde queries is aanzienlijk geoptimaliseerd.
- Het resourcebeheer is verbeterd: de efficiƫntie van geheugen- en CPU-gebruik op cluster nodes is verhoogd.
- De verdeling van gegevens over nodes en parallelle verwerking van queries is verbeterd.
- De strategieƫn voor back-up in gedistribueerde omgevingen zijn uitgebreid.
- Informatie over licenties en het opmaken van bestandsheaders met code zijn in overeenstemming gebracht met de vereisten van de Apache Foundation. Binaire artefacten zijn uit de releases in de broncode geƫlimineerd.
- Het bouwproces van componenten van het project in de talen C++ en Python is verbeterd.
Bron: opennet.ru
