Wydanie platformy do rozproszonego przetwarzania danych Apache Hadoop 3.3

Po roku i pół prac rozwojowych, organizacja Apache Software Foundation opublikowała wydanie Apache Hadoop 3.3.0, to otwarta platforma do organizacji rozproszonego przetwarzania dużych zbiorów danych z wykorzystaniem paradygmy map/reduce, w której zadanie dzieli się na wiele mniejszych, odizolowanych fragmentów, z których każdy może być uruchomiony na oddzielnym węźle klastra. System przechowywania oparty na Hadoop może obejmować tysiące węzłów i zawierać eksabajty danych.

W skład Hadoop wchodzi implementacja rozproszonego systemu plików Hadoop Distributed Filesystem (HDFS), który automatycznie zapewnia replikację danych i jest zoptymalizowany do pracy z aplikacjami MapReduce. Aby uprościć dostęp do danych w magazynie Hadoop, opracowano bazę danych HBase i język podobny do SQL Pig, który jest rodzajem SQL dla MapReduce, a zapytania mogą być równolegle przetwarzane przez wiele platform Hadoop. Projekt oceniany jest jako w pełni stabilny i gotowy do zastosowań przemysłowych. Hadoop jest aktywnie wykorzystywany w dużych projektach przemysłowych, oferując możliwości analogiczne do platformy Google Bigtable/GFS/MapReduce, przy czym firma Google oficjalnie delegowała Hadoop i innym projektom Apache prawo do korzystania z technologii objętych patentami, związanych z metodą MapReduce.

Hadoop zajmuje pierwsze miejsce wśród repozytoriów Apache pod względem liczby wprowadzanych zmian oraz piąte miejsce pod względem wielkości bazy kodu (około 4 miliony linii kodu). Wśród dużych wdrożeń Hadoop zaznaczają się magazyny Netflix (przechowujące ponad 500 miliardów zdarzeń dziennie), Twitter (klaster z 10 tysięcy węzłów w trybie rzeczywistym przechowuje ponad zettabajt danych i przetwarza ponad 5 miliardów sesji dziennie), Facebook (klaster z 4 tysiącami węzłów przechowuje ponad 300 petabajtów i codziennie zwiększa się o 4 PB dziennie).

Podstawowe zmiany w Apache Hadoop 3.3:

  • Dodano wsparcie dla platform opartych na architekturze ARM.
  • Implementacja formatu Protobuf (Protocol buffers), używanego do serializacji danych strukturalnych, została zaktualizowana do wydania 3.7.1 w związku z zakończeniem cyklu życia gałęzi protobuf-2.5.0.
  • Rozszerzone możliwości konektora S3A: dodano wsparcie dla uwierzytelniania za pomocą tokenów (Delegation Token), poprawiono wsparcie dla pamięci podręcznej odpowiedzi z kodem 404, zwiększono wydajność S3guard i poprawiono niezawodność działania.
  • W systemie plików ABFS rozwiązano problemy z automatycznym dostrajaniem.
  • Dodano wbudowane wsparcie dla systemu plików Tencent Cloud COS do uzyskiwania dostępu do obiektowego magazynu COS.
  • Dodano pełne wsparcie dla Javy 11.
  • Stabilizowano implementację HDFS RBF (Federacja oparta na Routerze). W Routerze HDFS dodano narzędzia zarządzania bezpieczeństwem.
  • Dodano usługę Rozwiązywania DNS do określania serwerów przez klientów za pomocą DNS według nazw węzłów, co pozwala na uniknięcie wymieniania wszystkich hostów w ustawieniach.
  • Dodano wsparcie dla harmonogramowania uruchamiania opportunistycznych kontenerów za pośrednictwem centralnego menedżera zasobów (ResourceManager), w tym możliwość rozdzielania kontenerów z uwzględnieniem obciążenia każdego węzła.
  • Dodano katalog aplikacji YARN (Yet Another Resource Negotiator) z możliwością wyszukiwania.

Źródło: opennet.ru

Kup solidny hosting stron z ochroną przed DDoS, serwery VPS VDS 🔥 Kup solidny hosting stron z ochroną przed DDoS, serwery VPS VDS | ProHoster