După un an și jumătate de dezvoltare, organizația Apache Software Foundation lansare , o platformă gratuită pentru organizarea procesării distribuite a unor volume mari de date folosind paradigma , în care sarcina este împărțită în numeroase fragmente mai mici, fiecare dintre ele putând fi rulat pe un nod separat al clusterei. Stocarea bazată pe Hadoop poate acoperi mii de noduri și conține exabiți de date.
Hadoop include implementarea sistemului de fișiere distribuit Hadoop Distributed Filesystem (HDFS), care asigură automat rezervarea datelor și este optimizat pentru aplicațiile MapReduce. Pentru a facilita accesul la datele din stocarea Hadoop, a fost dezvoltată baza de date HBase și un limbaj similar SQL numit Pig, care este un fel de SQL pentru MapReduce, a cărui interogări pot fi paralelizate și procesate de mai multe platforme Hadoop. Proiectul este evaluat ca fiind complet stabil și gata pentru utilizare industrială. Hadoop este utilizat activ în proiecte industriale mari, oferind funcționalități echivalente cu cele ale platformei Google Bigtable/GFS/MapReduce, iar compania Google a delegat oficial Hadoop și altor proiecte Apache pentru a utiliza tehnologii acoperite de brevete legate de metoda MapReduce.
Hadoop ocupă prima poziție în rândul repository-urilor Apache după numărul de modificări aduse și locul cinci după dimensiunea bazei de cod (aproximativ 4 milioane de linii de cod). Printre implementările majore ale Hadoop se numără stocările Netflix (care păstrează peste 500 de miliarde de evenimente pe zi), Twitter (un cluster de 10.000 de noduri în timp real, care stochează peste un zettabyte de date și procesează peste 5 miliarde de sesiuni pe zi), Facebook (un cluster de 4.000 de noduri stochează peste 300 de petabytes și crește zilnic cu 4 PB pe zi).
Principalele în Apache Hadoop 3.3:
- A fost adăugată suportul pentru platformele bazate pe arhitectura ARM.
- Implementarea formatului (Protocol buffers), utilizat pentru serializarea datelor structurate, a fost actualizată la versiunea 3.7.1 în urma încheierii ciclului de viață al ramurii protobuf-2.5.0.
- Funcționalitățile conectorului S3A au fost extinse: a fost adăugat suport pentru autentificarea prin token-uri (), a fost îmbunătățit suportul pentru cache-ul răspunsurilor cu codul 404, a fost crescută performanța S3guard și a fost îmbunătățită fiabilitatea acestuia.
- În sistemul de fișiere ABFS au fost rezolvate problemele legate de tune-ul automat.
- A fost adăugat suport încorporat pentru sistemul de fișiere Tencent Cloud COS pentru accesarea stocării obiectelor COS.
- A fost adăugat suport complet pentru Java 11.
- A fost stabilizată implementarea HDFS RBF (Federatia bazată pe Router). Au fost adăugate instrumente de gestionare a securității în Router-ul HDFS.
- A fost adăugat serviciul DNS Resolution pentru identificarea serverelor de către client prin DNS folosind numele gazdelor, reducând astfel nevoia de a lista toate gazdele în configurații.
- A fost adăugat suport pentru planificarea lansării prin intermediul managerului de resurse centralizat (ResourceManager), inclusiv posibilitatea de a distribui containere în funcție de sarcina fiecărui nod.
- A fost adăugat catalogul de aplicații YARN (Yet Another Resource Negotiator) cu opțiuni de căutare.
Sursa: opennet.ro
