Została wydana wersja rozproszonej bazy danych Apache Cloudberry 2.0.0, kontynuująca rozwój otwartego kodu bazy danych Greenplum, która została przekształcona przez firmę Broadcom w zamknięty produkt po przejęciu VMware. Apache Cloudberry 2.0.0 jest oznaczona jako pierwsza wersja projektu po przekazaniu kodu społeczności Apache. Projekt wciąż znajduje się w inkubatorze Apache i zostanie przeniesiony do grona głównych projektów Apache po przygotowaniu infrastruktury i zasobów.
Baza danych Cloudberry to rozproszona wersja otwartej bazy danych PostgreSQL, zoptymalizowana do wykonywania zapytań analitycznych na dużych zestawach danych (Data Warehouse). Do równoległego przetwarzania danych stosował architekturę masowo-równoległą (MPP, massively parallel processing), która zapewnia skalowalność pamięci masowej do petabajtowych rozmiarów dzięki segmentacji danych i wykorzystaniu klastra do przechowywania i przetwarzania. serwerów.
Wśród usprawnień w Apache Cloudberry 2.0.0:
- Dokonano przejścia na kod bazowy PostgreSQL 14 (Greenplum opierał się na PostgreSQL 12).
- Dodano wsparcie dla dynamicznych tabel, umożliwiających automatyczne aktualizowanie wyników zapytań. Nowa funkcjonalność jest przydatna przy konieczności pracy z bieżącymi danymi, na przykład do analizy danych w czasie rzeczywistym, architektury Lakehouse oraz zautomatyzowanych procesów ETL (Extract, Transform, Load).
- Wprowadzono nowy hybrydowy format magazynu PAX (Partition Attributes Across), łączący możliwości magazynów opartych na wierszach i kolumnach. Format PAX pozwala osiągnąć wysoką wydajność zarówno przy dużym obciążeniu zapisu, jak i przy realizacji zapytań analitycznych.
- Zostało znacznie zoptymalizowane planowanie i wykonywanie rozproszonych zapytań.
- Poprawiono zarządzanie zasobami: zwiększono efektywność pracy z pamięcią i CPU na węzłach klastra.
- Ulepszono rozdział danych na węzły i równoległe przetwarzanie zapytań.
- Rozszerzono strategie tworzenia kopii zapasowych w rozproszonych środowiskach.
- Informacje o licencjach oraz formatowanie nagłówków plików z kodem dostosowano do wymagań Fundacji Apache. Z wydań w kodzie źródłowym wykluczono binarne artefakty.
- Ulepszono proces kompilacji komponentów projektu w językach C++ i Python.
Źródło: opennet.ru
