Die Veröffentlichung der verteilten Datenbank Apache Cloudberry 2.0.0 wurde vorgestellt, die die Entwicklung der Open-Source-Codebasis der Datenbank Greenplum fortsetzt. Diese wurde nach der Übernahme von VMware durch die Firma Broadcom in ein Closed-Source-Produkt umgewandelt. Apache Cloudberry 2.0.0 wird als erste Version des Projekts betrachtet, das nach der Übertragung des Codes an die Apache-Community veröffentlicht wurde. Das Projekt befindet sich derzeit noch im Apache-Inkubator und wird in das Portfolio der primären Apache-Projekte überführt, sobald die Infrastruktur und die Unterstützungsdienste bereit sind.
Die Datenbank Cloudberry ist eine verteilte Edition der offenen Datenbank PostgreSQL, die für die Durchführung analytischer Abfragen über große Datenmengen (Data Warehouse) optimiert ist. Für die parallele Datenverarbeitung wird eine massiv parallele Architektur (MPP, massively parallel processing) verwendet, die eine Skalierung des Speichers auf Petabyte-Größen ermöglicht, indem die Daten in Segmente unterteilt und ein Cluster von Knoten zur Speicherung und Verarbeitung eingesetzt wird. Server.
Zu den Verbesserungen in Apache Cloudberry 2.0.0 gehören:
- Der Umstieg auf die Codebasis von PostgreSQL 14 wurde vollzogen (Greenplum basierte auf PostgreSQL 12).
- Die Unterstützung für dynamische Tabellen wurde hinzugefügt, die es ermöglichen, die Abfrageergebnisse automatisch zu aktualisieren. Diese neue Funktion ist nützlich, wenn mit aktuellen Daten gearbeitet werden muss, z.B. für die Echtzeitanalyse von Daten, Lakehouse-Architekturen und automatisierten ETL-Prozessoren (Extract, Transform, Load).
- Ein neues hybrides Speicherkonzept PAX (Partition Attributes Across) wurde implementiert, das die Möglichkeiten von zeilen- und spaltenbasierten Speichern kombiniert. Das PAX-Format ermöglicht eine hohe Leistung sowohl bei intensiven Schreibvorgängen als auch bei der Durchführung analytischer Abfragen.
- Die Planung und Ausführung von verteilten Abfragen wurde erheblich optimiert.
- Das Ressourcenmanagement wurde verbessert: Die Effizienz im Umgang mit Speicher und CPU an den Knoten im Cluster wurde gesteigert.
- Die Verteilung der Daten auf Knoten und die parallele Verarbeitung von Abfragen wurden optimiert.
- Die Strategien zur Datensicherung in verteilten Umgebungen wurden erweitert.
- Die Informationen zu Lizenzen und die Header-Formatierung der Code-Dateien wurden an die Anforderungen der Apache Foundation angepasst. Binärartefakte wurden aus den Veröffentlichungen im Quellcode entfernt.
- Der Prozess zur Erstellung der Komponenten des Projekts in den Programmiersprachen C++ und Python wurde verbessert.
Quelle: opennet.ru
