Po roku i pół prac rozwojowych, organizacja Apache Software Foundation wydanie , to otwarta platforma do organizacji rozproszonego przetwarzania dużych zbiorów danych z wykorzystaniem paradygmy , w której zadanie dzieli się na wiele mniejszych, odizolowanych fragmentów, z których każdy może być uruchomiony na oddzielnym węźle klastra. System przechowywania oparty na Hadoop może obejmować tysiące węzłów i zawierać eksabajty danych.
W skład Hadoop wchodzi implementacja rozproszonego systemu plików Hadoop Distributed Filesystem (HDFS), który automatycznie zapewnia replikację danych i jest zoptymalizowany do pracy z aplikacjami MapReduce. Aby uprościć dostęp do danych w magazynie Hadoop, opracowano bazę danych HBase i język podobny do SQL Pig, który jest rodzajem SQL dla MapReduce, a zapytania mogą być równolegle przetwarzane przez wiele platform Hadoop. Projekt oceniany jest jako w pełni stabilny i gotowy do zastosowań przemysłowych. Hadoop jest aktywnie wykorzystywany w dużych projektach przemysłowych, oferując możliwości analogiczne do platformy Google Bigtable/GFS/MapReduce, przy czym firma Google oficjalnie Hadoop i innym projektom Apache prawo do korzystania z technologii objętych patentami, związanych z metodą MapReduce.
Hadoop zajmuje pierwsze miejsce wśród repozytoriów Apache pod względem liczby wprowadzanych zmian oraz piąte miejsce pod względem wielkości bazy kodu (około 4 miliony linii kodu). Wśród dużych wdrożeń Hadoop zaznaczają się magazyny Netflix (przechowujące ponad 500 miliardów zdarzeń dziennie), Twitter (klaster z 10 tysięcy węzłów w trybie rzeczywistym przechowuje ponad zettabajt danych i przetwarza ponad 5 miliardów sesji dziennie), Facebook (klaster z 4 tysiącami węzłów przechowuje ponad 300 petabajtów i codziennie zwiększa się o 4 PB dziennie).
Podstawowe w Apache Hadoop 3.3:
- Dodano wsparcie dla platform opartych na architekturze ARM.
- Implementacja formatu (Protocol buffers), używanego do serializacji danych strukturalnych, została zaktualizowana do wydania 3.7.1 w związku z zakończeniem cyklu życia gałęzi protobuf-2.5.0.
- Rozszerzone możliwości konektora S3A: dodano wsparcie dla uwierzytelniania za pomocą tokenów (), poprawiono wsparcie dla pamięci podręcznej odpowiedzi z kodem 404, zwiększono wydajność S3guard i poprawiono niezawodność działania.
- W systemie plików ABFS rozwiązano problemy z automatycznym dostrajaniem.
- Dodano wbudowane wsparcie dla systemu plików Tencent Cloud COS do uzyskiwania dostępu do obiektowego magazynu COS.
- Dodano pełne wsparcie dla Javy 11.
- Stabilizowano implementację HDFS RBF (Federacja oparta na Routerze). W Routerze HDFS dodano narzędzia zarządzania bezpieczeństwem.
- Dodano usługę Rozwiązywania DNS do określania serwerów przez klientów za pomocą DNS według nazw węzłów, co pozwala na uniknięcie wymieniania wszystkich hostów w ustawieniach.
- Dodano wsparcie dla harmonogramowania uruchamiania za pośrednictwem centralnego menedżera zasobów (ResourceManager), w tym możliwość rozdzielania kontenerów z uwzględnieniem obciążenia każdego węzła.
- Dodano katalog aplikacji YARN (Yet Another Resource Negotiator) z możliwością wyszukiwania.
Źródło: opennet.ru
