Après un an et demi de développement, l'organisation Apache Software Foundation la sortie , est une plateforme open source pour l'organisation du traitement distribué de grandes quantités de données en utilisant la , où la tâche est divisée en de nombreux fragments plus petits, chacun pouvant être exécuté sur un nœud individuel du cluster. Le stockage basé sur Hadoop peut couvrir des milliers de nœuds et contenir des exabytes de données.
Hadoop comprend une implémentation du système de fichiers distribué Hadoop Distributed Filesystem (HDFS), garantissant automatiquement la redondance des données et optimisée pour les applications MapReduce. Pour simplifier l'accès aux données, une base de données HBase et un langage de type SQL nommé Pig ont été développés, qui fonctionne comme du SQL pour MapReduce, ses requêtes pouvant être parallélisées et traitées par plusieurs plateformes Hadoop. Le projet est classé comme entièrement stable et prêt pour une exploitation industrielle. Hadoop est largement utilisé dans de grands projets industriels, offrant des fonctionnalités similaires à celles de la plateforme Google Bigtable/GFS/MapReduce, tandis que Google a officiellement Hadoop et d'autres projets Apache le droit d'utiliser des technologies couvertes par des brevets liés à la méthode MapReduce.
Hadoop se classe au premier rang parmi les dépôts Apache en termes de modifications apportées et cinquième en taille de code (environ 4 millions de lignes de code). Parmi les grandes implémentations de Hadoop, on cite les systèmes de stockage de Netflix (stockant plus de 500 milliards d'événements par jour), Twitter (un cluster de 10 000 nœuds en temps réel stocke plus d'un zettabyte de données et traite plus de 5 milliards de sessions par jour), Facebook (un cluster de 4 000 nœuds stocke plus de 300 petabytes, augmentant quotidiennement de 4 To par jour).
Principales dans Apache Hadoop 3.3 :
- Ajout de la prise en charge des plateformes basées sur l'architecture ARM.
- L'implémentation du format (Protocol buffers), utilisé pour la sérialisation des données structurées, a été mise à jour vers la version 3.7.1 en raison de la fin du cycle de vie de la branche protobuf-2.5.0.
- Les capacités du connecteur S3A ont été étendues : ajout de la prise en charge de l'authentification par jetons (), amélioration du support du cache des réponses avec code 404, augmentation de la performance de S3guard, et renforcement de la fiabilité.
- Dans le système de fichiers ABFS, les problèmes d'ajustement automatique ont été résolus.
- Ajout du support natif du système de fichiers Tencent Cloud COS pour accéder au stockage d'objets COS.
- Ajout du support complet pour Java 11.
- La mise en œuvre de HDFS RBF (Federation basée sur le routeur) a été stabilisée. Des outils de gestion de la sécurité ont été ajoutés au routeur HDFS.
- Ajout d'un service de résolution DNS pour permettre aux clients de trouver des serveurs via DNS par le nom des nœuds, évitant ainsi d'énumérer tous les hôtes dans les configurations.
- Ajout de la prise en charge de la planification de démarrage via le gestionnaire de ressources centralisé (ResourceManager), y compris la possibilité de distribuer des conteneurs en tenant compte de la charge de chaque nœud.
- Ajout d'un annuaire d'applications YARN (Yet Another Resource Negotiator) avec fonctions de recherche.
Source : opennet.ru
