Freigabe der Plattform für verteilte Datenverarbeitung Apache Hadoop 3.3

Nach anderthalb Jahren Entwicklung hat die Apache Software Foundation die Release Apache Hadoop 3.3.0, eine Open-Source-Plattform für die verteilte Verarbeitung großer Datenmengen unter Verwendung des MapReduce-Paradigmas, bei dem eine Aufgabe in viele kleinere, separate Fragmente unterteilt wird, die jeweils auf einem einzelnen Knoten des Clusters ausgeführt werden können. Das Hadoop-basierte Speicher kann Tausende von Knoten abdecken und Exabytes an Daten enthalten.

Hadoop umfasst die Implementierung eines verteilten Dateisystems, des Hadoop Distributed Filesystem (HDFS), das automatisch Datenredundanz gewährleistet und für MapReduce-Anwendungen optimiert ist. Um den Datenzugriff zu erleichtern, wurde eine Datenbank namens HBase und eine SQL-ähnliche Sprache namens Pig entwickelt, die eine Art SQL für MapReduce ist, dessen Abfragen parallelisiert und von mehreren Hadoop-Plattformen verarbeitet werden können. Das Projekt wird als voll stabil und bereit für den industriellen Einsatz angesehen. Hadoop wird aktiv in großen Industrieprojekten eingesetzt und bietet Funktionen, die der Plattform Google Bigtable/GFS/MapReduce ähnlich sind, wobei das Unternehmen Google offiziell delegiert hat Hadoop und anderen Apache-Projekten steht das Recht zur Nutzung von Technologien zu, die durch Patente über das MapReduce-Verfahren geschützt sind.

Hadoop belegt den ersten Platz unter den Apache-Repositories in Bezug auf die Anzahl der Änderungen und den fünften Platz in der Größe des Codes (rund 4 Millionen Zeilen). Zu den großen Implementierungen von Hadoop gehören die Repositories von Netflix (über 500 Milliarden Ereignisse pro Tag), Twitter (ein Cluster mit 10.000 Knoten speichert in Echtzeit über ein Zettabyte Daten und verarbeitet mehr als 5 Milliarden Sitzungen täglich) und Facebook (ein Cluster mit 4.000 Knoten speichert über 300 Petabyte und wächst täglich um 4 Terabyte).

Haupt eingeführt wurde, die im Januar dieses Jahres in den Kernel übernommen wurde. Es betrifft ausschließlich die Version 5.1 und tritt in den meisten Fällen auf Systemen mit Samsung-SSD-Speichern auf, bei denen zur Verschlüsselung Daten mit dm-crypt/LUKS über device-mapper/LVM verwendet werden. in Apache Hadoop 3.3:

  • Unterstützung für Plattformen auf ARM-Architektur hinzugefügt.
  • Die Implementierung des Formats Protobuf (Protocol Buffers), welches zur Serialisierung strukturierter Daten verwendet wird, wurde auf Version 3.7.1 aktualisiert aufgrund des Endes des Lebenszyklus des protobuf-2.5.0-Zweigs.
  • Die Möglichkeiten des S3A-Connectors wurden erweitert: Unterstützung für Authentifizierung mit Tokens hinzugefügt (Delegation Token), verbesserte Unterstützung für das Caching von 404-Antworten, gesteigerte Leistung von S3guard und erhöhte Zuverlässigkeit.
  • In der ABFS-Dateisystem wurden Probleme mit der automatischen Optimierung behoben.
  • Es wurde native Unterstützung des Tencent Cloud COS-Dateisystems für den Zugriff auf den COS-Objektspeicher hinzugefügt.
  • Vollständige Unterstützung für Java 11 wurde hinzugefügt.
  • Die Implementierung von HDFS RBF (Router-Based Federation) wurde stabilisiert. Sicherheitsverwaltungsmittel wurden zum HDFS-Router hinzugefügt.
  • Ein DNS-Resolution-Service wurde hinzugefügt, um Server über DNS basierend auf den Knotennamen zu identifizieren, sodass eine Auflistung aller Hosts in den Einstellungen nicht erforderlich ist.
  • Unterstützung für das Startzeitplanung wurde hinzugefügt. opportunistische Container über einen zentralen Ressourcenmanager (ResourceManager), einschließlich der Möglichkeit, Container unter Berücksichtigung der Last jedes Knotens zu verteilen.
  • Ein YARN (Yet Another Resource Negotiator)-Anwendungenverzeichnis mit Suchfunktionalität wurde hinzugefügt.

Quelle: opennet.ru

Zuverlässiges Webhosting mit DDoS-Schutz, VPS- und VDS-Server kaufen 🔥 Zuverlässiges Webhosting mit DDoS-Schutz, VPS- und VDS-Server kaufen | ProHoster