Después de un año y medio de desarrollo, la organización Apache Software Foundation lanzamiento , una plataforma libre para la organización del procesamiento distribuido de grandes cantidades de datos utilizando la parábola , donde la tarea se divide en numerosos fragmentos más pequeños, cada uno de los cuales puede ser ejecutado en un nodo separado del clúster. El almacenamiento basado en Hadoop puede abarcar miles de nodos y contener exabytes de datos.
Hadoop incluye la implementación de un sistema de archivos distribuido, Hadoop Distributed Filesystem (HDFS), que proporciona automáticamente la redundancia de datos y está optimizado para aplicaciones MapReduce. Para simplificar el acceso a los datos en el almacenamiento Hadoop, se desarrolló la base de datos HBase y un lenguaje similar a SQL llamado Pig, que es una especie de SQL para MapReduce, cuyas consultas pueden ser paralelizadas y procesadas por varias plataformas Hadoop. El proyecto se considera completamente estable y listo para explotación industrial. Hadoop se utiliza activamente en grandes proyectos industriales, proporcionando capacidades similares a la plataforma de Google Bigtable/GFS/MapReduce, y la empresa Google ha a Hadoop y otros proyectos de Apache el derecho a utilizar tecnologías cubiertas por patentes relacionadas con el método MapReduce.
Hadoop ocupa el primer lugar entre los repositorios de Apache por el número de cambios realizados y el quinto lugar por el tamaño de su base de código (aproximadamente 4 millones de líneas de código). Entre las implementaciones importantes de Hadoop se encuentran los almacenes de Netflix (que almacenan más de 500 mil millones de eventos al día), Twitter (un clúster de 10,000 nodos en tiempo real que almacena más de un zetabyte de datos y procesa más de 5 mil millones de sesiones al día) y Facebook (un clúster de 4,000 nodos que almacena más de 300 petabytes y aumenta diariamente en 4 PB).
Principales en Apache Hadoop 3.3:
- Se agregó soporte para plataformas basadas en la arquitectura ARM.
- La implementación del formato (Protocol Buffers), utilizado para la serialización de datos estructurados, se actualizó a la versión 3.7.1 debido al final del ciclo de vida de la rama protobuf-2.5.0.
- Se ampliaron las capacidades del conector S3A: se agregó soporte para autenticación mediante tokens (), mejorada la capacidad de almacenamiento en caché de respuestas con código 404, aumentada la eficiencia de S3guard y mejorada la fiabilidad del funcionamiento.
- En el sistema de archivos ABFS se han resuelto problemas con la sintonización automática.
- Se agregó soporte incorporado para el sistema de archivos Tencent Cloud COS para acceder al almacenamiento de objetos COS.
- Se agregó soporte completo para Java 11.
- Se estabilizó la implementación de HDFS RBF (Federación basada en routers). Se añadieron herramientas de gestión de seguridad al Router HDFS.
- Se añadió el servicio de Resolución DNS para que los clientes identifiquen servidores a través de DNS por nombres de host, lo que elimina la necesidad de enumerar todos los hosts en la configuración.
- Se agregó soporte para la planificación de arranques a través del administrador de recursos centralizado (ResourceManager), incluida la capacidad de distribuir contenedores teniendo en cuenta la carga de cada nodo.
- Se añadió un catálogo de aplicaciones YARN (Yet Another Resource Negotiator) con capacidades de búsqueda.
Fuente: opennet.ru
