La version 2.0.0 de la base de données distribuée Apache Cloudberry a été présentée, continuant le développement de la base de code ouverte de la base de données Greenplum, qui a été transformée en produit fermé par Broadcom aprÚs l'acquisition de VMware. Apache Cloudberry 2.0.0 est marqué comme le premier lancement du projet aprÚs le transfert du code à la communauté Apache. Le projet est encore en incubation Apache et sera transféré au nombre des projets principaux d'Apache une fois l'infrastructure et le support opérationnels.
La base de donnĂ©es Cloudberry est une Ă©dition distribuĂ©e de la base de donnĂ©es ouverte PostgreSQL, optimisĂ©e pour exĂ©cuter des requĂȘtes analytiques sur de grands ensembles de donnĂ©es (Data Warehouse). Pour le traitement parallĂšle des donnĂ©es, une architecture de traitement massivement parallĂšle (MPP) est utilisĂ©e, permettant d'Ă©chelonner le stockage jusqu'Ă des tailles de pĂ©taoctets grĂące Ă la division des donnĂ©es en segments et Ă l'utilisation d'un cluster. serveurs.
Parmi les améliorations de Apache Cloudberry 2.0.0 :
- Migration vers la base de code PostgreSQL 14 (Greenplum était basé sur PostgreSQL 12).
- Ajout de la prise en charge des tables dynamiques, permettant de mettre Ă jour automatiquement les rĂ©sultats des requĂȘtes. Cette nouvelle fonctionnalitĂ© est utile pour travailler avec des donnĂ©es en temps rĂ©el, par exemple, pour l'analyse de donnĂ©es en temps rĂ©el, l'architecture Lakehouse et les processeurs ETL (Extract, Transform, Load) automatisĂ©s.
- Un nouveau format de stockage hybride PAX (Partition Attributes Across) a Ă©tĂ© rĂ©alisĂ©, combinant les capacitĂ©s des stockages basĂ©s sur les lignes et les colonnes. Le format PAX permet d'atteindre une haute performance aussi bien sous une forte charge d'Ă©criture que lors de l'exĂ©cution de requĂȘtes analytiques.
- La planification et l'exĂ©cution des requĂȘtes distribuĂ©es ont Ă©tĂ© considĂ©rablement optimisĂ©es.
- La gestion des ressources a Ă©tĂ© amĂ©liorĂ©e : l'efficacitĂ© de l'utilisation de la mĂ©moire et du CPU sur les nĆuds du cluster a Ă©tĂ© augmentĂ©e.
- La rĂ©partition des donnĂ©es entre les nĆuds et le traitement parallĂšle des requĂȘtes ont Ă©tĂ© amĂ©liorĂ©s.
- Les stratégies de sauvegarde dans des environnements distribués ont été élargies.
- Les informations sur les licences et la mise en forme des en-tĂȘtes de fichiers de code ont Ă©tĂ© mises en conformitĂ© avec les exigences de la Fondation Apache. Les artefacts binaires ont Ă©tĂ© exclus des versions dans le code source.
- Le processus de construction des composants du projet en C++ et Python a été amélioré.
Source : opennet.ru
