Veröffentlichung der Plattform für verteilte Datenverarbeitung Apache Hadoop 3.3

Nach anderthalb Jahren Entwicklung hat die Apache Software Foundation veröffentlicht Release Apache Hadoop 3.3.0, eine freie Plattform zur Organisation der verteilten Verarbeitung großer Datenmengen unter Verwendung des Paradigmas map/reduce, bei dem die Aufgabe in viele kleinere, getrennte Fragmente zerlegt wird, von denen jedes auf einem separaten Knoten im Cluster ausgeführt werden kann. Das auf Hadoop basierende Speicher kann Tausende von Knoten umfassen und Exabytes an Daten enthalten.

Hadoop umfasst die Implementierung des verteilten Dateisystems Hadoop Distributed Filesystem (HDFS), das automatisch Datensicherung gewährleistet und für MapReduce-Anwendungen optimiert ist. Um den Datenzugriff in Hadoop zu vereinfachen, wurde die Datenbank HBase und die SQL-ähnliche Sprache Pig entwickelt, die eine Art SQL für MapReduce ist, deren Abfragen parallelisiert und von mehreren Hadoop-Plattformen verarbeitet werden können. Das Projekt wird als vollständig stabil und bereit für den industriellen Einsatz angesehen. Hadoop wird aktiv in großen Industrieprojekten eingesetzt und bietet ähnliche Möglichkeiten wie die Plattform Google Bigtable/GFS/MapReduce, wobei Google offiziell die Hadoop- und andere Apache-Projekte mit dem Recht delegiert hat, Technologien zu nutzen, die durch Patente in Bezug auf die Methode MapReduce abgedeckt sind.

Hadoop belegt den ersten Platz unter den Apache-Repositories hinsichtlich der Anzahl der Änderungen und den fünften Platz nach der Größe des Codebasis (etwa 4 Millionen Zeilen Code). Zu den größeren Implementierungen von Hadoop zählen die Lager von Netflix (über 500 Milliarden Ereignisse pro Tag), Twitter (ein Cluster von 10.000 Knoten speichert in Echtzeit über ein Zettabyte Daten und verarbeitet über 5 Milliarden Sitzungen pro Tag) und Facebook (ein Cluster aus 4.000 Knoten speichert über 300 Petabyte und wächst täglich um 4 PB pro Tag).

Haupt- Änderungen in Apache Hadoop 3.3:

  • Unterstützung für Arm-Architektur-basierte Plattformen hinzugefügt.
  • Die Implementierung des Formats Protobuf (Protocol Buffers), das zur Serialisierung strukturierter Daten verwendet wird, wurde auf die Version 3.7.1 aktualisiert, da der Lebenszyklus des Branches protobuf-2.5.0 abgeschlossen ist.
  • Die Möglichkeiten des S3A-Connectors wurden erweitert: Unterstützung für die Authentifizierung mit Token hinzugefügt (Delegation Token), verbesserte Unterstützung für das Caching von 404-Antworten, erhöhte Leistung von S3guard und verbesserte Zuverlässigkeit.
  • Im ABFS-Dateisystem wurden Probleme mit der automatischen Feinabstimmung behoben.
  • Integrierte Unterstützung für das Dateisystem Tencent Cloud COS wurde hinzugefügt, um auf den COS Objektspeicher zuzugreifen.
  • Vollständige Unterstützung für Java 11 wurde hinzugefügt.
  • Die Implementierung von HDFS RBF (Router-basierte Federation) wurde stabilisiert. Sicherheitsmanagement-Tools wurden zum HDFS-Router hinzugefügt.
  • Ein DNS-Auflösungsdienst wurde hinzugefügt, um Servernamen über DNS zu identifizieren, wodurch eine Auflistung aller Hosts in den Einstellungen entfällt.
  • Unterstützung für die Zeitplanung von Starts hinzugefügt opportunistischen Containern über einen zentralisierten Ressourcenmanager (ResourceManager), einschließlich der Möglichkeit, Container unter Berücksichtigung der Last jedes Knotens zu verteilen.
  • Ein YARN-Anwendungs-Katalog (Yet Another Resource Negotiator) mit Suchfunktionen wurde hinzugefügt.

Quelle: opennet.ru

60GB SSD 8Gb DDR4