Rilascio della piattaforma per l'elaborazione distribuita dei dati Apache Hadoop 3.3

Dopo un anno e mezzo di sviluppo, l'organizzazione Apache Software Foundation ha pubblicato il rilascio Apache Hadoop 3.3.0, una piattaforma open source per organizzare l'elaborazione distribuita di grandi quantità di dati utilizzando il paradigma map/reduce, dove il compito viene suddiviso in numerosi frammenti più piccoli e separati, ognuno dei quali può essere eseguito su un nodo distinto del cluster. Lo storage basato su Hadoop può coprire migliaia di nodi e contenere exabyte di dati.

Hadoop include l'implementazione di un sistema di file distribuiti chiamato Hadoop Distributed Filesystem (HDFS), che garantisce automaticamente il backup dei dati ed è ottimizzato per le applicazioni MapReduce. Per semplificare l'accesso ai dati nello storage Hadoop, è stata sviluppata la database HBase e il linguaggio simile a SQL Pig, che rappresenta una sorta di SQL per MapReduce, i cui query possono essere parallellizzati e elaborati su più piattaforme Hadoop. Il progetto è valutato come completamente stabile e pronto per l'uso industriale. Hadoop è attivamente utilizzato in grandi progetti industriali, offrendo funzionalità simili a quelle delle piattaforme Google Bigtable/GFS/MapReduce; inoltre, Google ha ufficialmente delega Hadoop e ad altri progetti Apache i diritti di utilizzo delle tecnologie coperte da brevetti collegati al metodo MapReduce.

Hadoop occupa il primo posto tra i repository Apache per numero di modifiche e il quinto posto per dimensioni della base di codice (circa 4 milioni di righe di codice). Tra le grandi implementazioni di Hadoop ci sono gli storage di Netflix (che conserva oltre 500 miliardi di eventi al giorno), Twitter (un cluster di 10.000 nodi in tempo reale conserva oltre un zettabyte di dati e gestisce oltre 5 miliardi di sessioni al giorno), Facebook (un cluster di 4.000 nodi conserva oltre 300 petabyte e cresce di 4 PB al giorno).

Principali cambiamenti in Apache Hadoop 3.3:

  • È stato aggiunto il supporto per piattaforme basate sull'architettura ARM.
  • L'implementazione del formato Protobuf (Protocol buffers), utilizzato per la serializzazione di dati strutturati, è stata aggiornata alla versione 3.7.1 a causa della fine del ciclo di vita della ramificazione protobuf-2.5.0.
  • Sono state ampliate le funzionalità del connettore S3A: è stato aggiunto il supporto per l'autenticazione tramite token (Delegation Token), è stato migliorato il supporto per la cache delle risposte con codice 404, aumentata la performance di S3guard, migliorata l'affidabilità dell'operatività.
  • Nella file system ABFS sono stati risolti problemi di tuning automatico.
  • Aggiunto il supporto integrato per il file system Tencent Cloud COS per l'accesso allo storage oggetti COS.
  • Aggiunto il supporto completo per Java 11.
  • Stabilizzata l'implementazione di HDFS RBF (Router-based Federation). Nel router HDFS sono stati aggiunti strumenti per la gestione della sicurezza.
  • Aggiunto il servizio di risoluzione DNS per determinare i server tramite DNS in base ai nomi dei nodi, consentendo di evitare l'elenco di tutti gli host nelle impostazioni.
  • Aggiunto il supporto per la pianificazione dell'avvio di contenitori opportunistici tramite il gestore delle risorse centralizzato (ResourceManager), inclusa la possibilità di distribuire contenitori tenendo conto del carico di ogni nodo.
  • Aggiunto un catalogo delle applicazioni YARN (Yet Another Resource Negotiator) con funzione di ricerca.

Fonte: opennet.ru

Acquista hosting affidabile per siti web con protezione DDoS, VPS VDS server 🔥 Acquista hosting affidabile per siti web con protezione DDoS, VPS VDS server | ProHoster