Se ha lanzado la versión 2.0.0 de la base de datos distribuida Apache Cloudberry, que continúa el desarrollo de la base de código abierta de la base de datos Greenplum, transformada por Broadcom en un producto cerrado tras adquirir VMware. Apache Cloudberry 2.0.0 se marca como la primera versión del proyecto, después de la transferencia del código a la comunidad Apache. El proyecto aún está en la incubadora de Apache y se convertirá en uno de los proyectos primarios de Apache una vez que la infraestructura y el soporte estén listos.
La base de datos Cloudberry es una edición distribuida de la base de datos abierta PostgreSQL, optimizada para realizar consultas analíticas sobre grandes volúmenes de datos (Data Warehouse). Para el procesamiento paralelo de datos se aplica una arquitectura de procesamiento masivamente paralelo (MPP, massively parallel processing), que permite la escalabilidad del almacenamiento hasta tamaños de petabytes mediante la división de datos en segmentos y la utilización de un clúster. servidores.
Entre las mejoras en Apache Cloudberry 2.0.0:
- Se ha realizado la transición a la base de código PostgreSQL 14 (Greenplum se basaba en PostgreSQL 12).
- Se ha añadido soporte para tablas dinámicas, permitiendo actualizar automáticamente los resultados de las consultas. Esta nueva función es útil para trabajar con datos actuales, por ejemplo, para análisis de datos en tiempo real, arquitecturas Lakehouse y procesadores ETL automatizados (Extracción, Transformación, Carga).
- Se ha implementado un nuevo formato híbrido de almacenamiento PAX (Partition Attributes Across), que combina las capacidades de los almacenes basados en filas y columnas. El formato PAX permite lograr un alto rendimiento tanto en cargas de escritura intensivas como en la ejecución de consultas analíticas.
- Se ha optimizado significativamente la planificación y ejecución de consultas distribuidas.
- Se ha mejorado la gestión de recursos: se ha incrementado la eficiencia en el uso de la memoria y el CPU en los nodos del clúster.
- Se ha mejorado la distribución de datos entre nodos y el procesamiento paralelo de consultas.
- Se han ampliado las estrategias de copia de seguridad en entornos distribuidos.
- La información sobre licencias y la formalización de los encabezados de archivos de código se ha alineado con los requisitos de la Fundación Apache. Se han eliminado los artefactos binarios de las versiones en código fuente.
- Se ha mejorado el proceso de construcción de los componentes del proyecto en los lenguajes C++ y Python.
Fuente: opennet.ru
