Dopo un anno e mezzo di sviluppo, l'organizzazione Apache Software Foundation rilascio , è una piattaforma open source per l'elaborazione distribuita di grandi volumi di dati utilizzando la paradigma , in cui un compito viene suddiviso in numerosi frammenti più piccoli e separati, ognuno dei quali può essere eseguito su un nodo diverso del cluster. Un sistema di archiviazione basato su Hadoop può coprire migliaia di nodi e contenere exabyte di dati.
Hadoop include un'implementazione del sistema di file distribuito Hadoop Distributed Filesystem (HDFS), che fornisce automaticamente la ridondanza dei dati ed è ottimizzato per l'esecuzione di applicazioni MapReduce. Per semplificare l'accesso ai dati nel sistema Hadoop, è stato sviluppato il database HBase e un linguaggio simile a SQL chiamato Pig, che è una sorta di SQL per MapReduce, i cui interrogativi possono essere parallelizzati e elaborati da più piattaforme Hadoop. Il progetto è considerato completamente stabile e pronto per l'uso industriale. Hadoop è ampiamente utilizzato in grandi progetti industriali, offrendo funzionalità simili alla piattaforma Google Bigtable/GFS/MapReduce, mentre la Google ha ufficialmente Hadoop e ad altri progetti Apache hanno il diritto di utilizzare tecnologie soggette a brevetti relativi al metodo MapReduce.
Hadoop si posiziona al primo posto tra i repository Apache per numero di modifiche apportate e al quinto posto per dimensione del codice sorgente (circa 4 milioni di righe di codice). Tra le principali implementazioni di Hadoop si segnalano gli archivi di Netflix (che conserva oltre 500 miliardi di eventi al giorno), Twitter (un cluster di 10.000 nodi in tempo reale gestisce oltre un zettabyte di dati e oltre 5 miliardi di sessioni al giorno), Facebook (un cluster di 4.000 nodi immagazzina oltre 300 petabyte e aumenta di 4 PB al giorno).
Principali in Apache Hadoop 3.3:
- Aggiunta la supporto per le piattaforme basate su architettura ARM.
- L'implementazione del formato (Protocol buffers), utilizzato per la serializzazione di dati strutturati, è stata aggiornata alla versione 3.7.1 a causa della fine del ciclo di vita della branch protobuf-2.5.0.
- Le funzionalità del connettore S3A sono state ampliate: aggiunto supporto per l'autenticazione con token (), migliorato il supporto per la memorizzazione nella cache delle risposte con codice 404, aumentata la produttività di S3guard e migliorata l'affidabilità operativa.
- Nel file system ABFS sono stati risolti i problemi di ottimizzazione automatica.
- Aggiunto il supporto integrato per il file system Tencent Cloud COS per l'accesso allo storage a oggetti COS.
- Aggiunto il supporto completo per Java 11.
- Stabilizzata l'implementazione di HDFS RBF (Router-based Federation). Aggiunti strumenti di gestione della sicurezza nel Router HDFS.
- Aggiunto il servizio DNS Resolution per consentire ai client di individuare i server tramite DNS utilizzando i nomi degli host, eliminando la necessità di elencare tutti gli host nelle impostazioni.
- Aggiunta la supporto per la pianificazione dell'avvio tramite un gestore delle risorse centralizzato (ResourceManager), inclusa la possibilità di distribuire i container in base al carico di ciascun nodo.
- Aggiunto un catalogo delle applicazioni YARN (Yet Another Resource Negotiator) con funzionalità di ricerca.
Fonte: opennet.ru
