Secondo , l'ingegnere dei dati è attualmente una professione la cui domanda cresce più rapidamente di tutte le altre. L'ingegnere dei dati svolge un ruolo critico nelle organizzazioni: crea e mantiene pipeline e database operativi utilizzati per l'elaborazione, la trasformazione e lo stoccaggio dei dati. Quali competenze sono necessarie ai professionisti di questo settore? La lista differisce da quella richiesta agli scienziati dei dati? Scoprirai tutto questo nel mio articolo.
Ho analizzato le offerte di lavoro per la posizione di ingegnere dei dati così come si presentano a gennaio 2020, per capire quali competenze tecnologiche sono più richieste. Ho poi confrontato i risultati con le statistiche delle offerte per la posizione di scienziato dei dati, rivelando alcune interessanti differenze.
Senza giri di parole, ecco le dieci tecnologie che vengono menzionate più frequentemente nei testi delle offerte di lavoro:

Menzioni delle tecnologie nelle offerte per la posizione di ingegnere dei dati nel 2020
Analizziamo.
Responsabilità dell'ingegnere dei dati
Oggi, il lavoro svolto dai data engineer è di enorme importanza per le organizzazioni: sono queste persone a occuparsi dell'archiviazione delle informazioni e a prepararle affinché altri dipendenti possano lavorarci. I data engineer costruiscono pipeline per gestire l'acquisizione di dati, sia in streaming che in batch, da molteplici fonti. Le pipeline eseguono operazioni di estrazione, trasformazione e caricamento (in altre parole, i processi ETL), rendendo i dati più utilizzabili per successivi impieghi. Successivamente, i dati vengono forniti ad analisti e data scientist per un'analisi più approfondita. Infine, i dati terminano il loro viaggio su dashboard, report e modelli di machine learning.
Stavo cercando informazioni che potessero offrire un'indicazione sulle tecnologie più richieste nel lavoro di data engineer al momento attuale.
I metodi
Ho raccolto informazioni da tre siti web di ricerca lavoro — , e e ho esaminato quali parole chiave sono associate a "data engineer" nei testi delle offerte di lavoro rivolte ai residenti negli Stati Uniti. Per questo compito, ho utilizzato due librerie Python — e . Ho incluso parole chiave sia da precedenti elenchi per l'analisi delle offerte per la posizione di data scientist, sia quelle selezionate manualmente leggendo le offerte di lavoro per data engineer. LinkedIn non è stato incluso tra le fonti, poiché sono stato bannato dopo il mio ultimo tentativo di raccogliere dati.
Per ogni parola chiave, ho calcolato la percentuale di occorrenze rispetto al numero totale di testi su ciascun sito separatamente, e poi ho calcolato il valore medio tra le tre fonti.
Risultati
Di seguito sono riportati trenta termini tecnici nel campo del data engineering con i punteggi più alti su tutti e tre i siti di lavoro.

Ecco gli stessi numeri, ma presentati in forma di tabella:

Procediamo in ordine.
Panoramica dei risultati
Sia SQL che Python compaiono in più di due terzi delle offerte esaminate. Queste sono le due tecnologie che ha senso studiare per prime. – un linguaggio di programmazione molto popolare, utilizzato per lavorare con i dati, creare siti web e scrivere script. significa linguaggio di query strutturato (SQL); rappresenta uno standard implementato da un gruppo di linguaggi e viene utilizzato per estrarre dati da database relazionali. È emerso molto tempo fa e ha dimostrato di avere una grande resilienza.
Di Spark si parla in circa metà delle offerte di lavoro. è "un motore analitico unificato per l'elaborazione dei big data con moduli integrati per il streaming, SQL, machine learning e elaborazione di grafi". È particolarmente popolare tra coloro che lavorano con database di grandi dimensioni.
AWS compare in circa il 45% dei testi delle offerte di lavoro. Questa è una piattaforma di calcolo cloud di Amazon; ha la quota di mercato più ampia tra tutte le piattaforme cloud.
Segue Java e Hadoop – poco più del 40% per ciascuno. è un linguaggio ampiamente utilizzato e collaudato, che si si è piazzato decimo tra i linguaggi che spaventano di più i programmatori. Al contrario, Python si è rivelato il secondo linguaggio maggiormente amato. Il linguaggio Java è gestito da Oracle, e tutto ciò che c'è da sapere può essere compreso da questo screenshot della pagina ufficiale risalente a gennaio 2020.

Come se avessi fatto un viaggio nel tempo
utilizza il modello di programmazione MapReduce con cluster di server per gestire grandi dati. Attualmente, questo modello viene sempre più abbandonato.
Poi vediamo Hive, Scala, Kafka e NoSQL – ognuna di queste tecnologie è menzionata in un quarto delle offerte di lavoro presentate. Apache Hive è un programma di archiviazione dei dati che 'semplifica la lettura, la scrittura e la gestione di grandi set di dati situati in archivi distribuiti, utilizzando SQL.' è un linguaggio di programmazione ampiamente utilizzato per lavorare con i big data. In particolare, Spark è stato sviluppato in Scala. Nella già menzionata classifica dei linguaggi spaventosi, Scala occupa l'undicesima posizione. è una piattaforma distribuita per l'elaborazione di messaggi in streaming. È molto popolare come mezzo per la trasmissione di dati.
si contrappongono a SQL. Si differenziano per il fatto di non essere relazionali, non strutturati e di avere una scalabilità orizzontale. NoSQL ha guadagnato una certa popolarità, ma la frenesia che circondava questo approccio, fino a profezie che avrebbe sostituito SQL come paradigma dominante di archiviazione, sembra ormai superata.
Confronto con i termini nelle offerte di lavoro per data scientist
Ecco trenta termini tecnologici più comuni tra i datori di lavoro nel settore della data science. Questo elenco l'ho ottenuto utilizzando lo stesso metodo descritto in precedenza per il data engineering.

Menzioni di tecnologie nelle offerte di lavoro per la posizione di data scientist nel 2020
Parlando in termini assoluti, rispetto al set esaminato in precedenza, ci sono state il 28% di offerte in più (12.013 contro 9.396). Vediamo quali tecnologie appaiono nelle offerte per data scientist meno frequentemente rispetto a quelle per data engineer.
Più popolari nel data engineering
Nel grafico sottostante sono rappresentate le parole chiave con una differenza media nei valori superiore al 10% o inferiore al -10%.

Le maggiori differenze nella frequenza delle parole chiave tra data engineer e data scientist
La crescita più significativa è registrata da AWS: nel data engineering appare con una frequenza superiore del 25% rispetto al data science (circa il 45% e il 20% del totale delle offerte di lavoro rispettivamente). La differenza è notevole!
Ecco gli stessi dati in una forma leggermente diversa: nel grafico, i risultati per la stessa parola chiave nelle offerte di lavoro per data engineer e data scientist sono affiancati.

Le maggiori differenze nella frequenza delle parole chiave tra data engineer e data scientist
Il salto successivo più grande l'ho notato in Spark: il data engineer spesso deve lavorare con grandi volumi di dati. è aumentato anche del 20%, ovvero quasi quattro volte rispetto ai risultati delle offerte di lavoro per data scientist. La gestione dei dati è una delle principali responsabilità del data engineer. Infine, il numero di menzioni è stato maggiore del 15% nel data engineering per Java, NoSQL, Redshift, SQL e Hadoop.
Meno popolari nel data engineering
Ora diamo un'occhiata a quali tecnologie sono meno popolari nelle offerte di lavoro per data engineer.
Il calo più netto rispetto al data science è avvenuto per : qui figurava in circa il 56% delle offerte, qui – solo nel 17%. Impressionante. R è un linguaggio di programmazione molto apprezzato tra scienziati e statistici e occupa l'ottavo posto nella classifica dei linguaggi più temuti.
si trova anche nelle offerte di lavoro per la posizione di data engineer in misura significativamente inferiore: la differenza è del 14%. SAS è un linguaggio brevettato progettato per lavorare con statistiche e dati. Un punto interessante: a giudicare dai risultati , ultimamente ha perso molto terreno – più di qualsiasi altra tecnologia.
Richieste sia in data engineering che in data science
Va notato che otto delle dieci posizioni principali in entrambi i set di dati coincidono. SQL, Python, Spark, AWS, Java, Hadoop, Hive e Scala sono entrati nella top ten sia per il settore data engineering che per la data science. Nella grafica qui sotto puoi vedere le quindici tecnologie più popolari tra i datori di lavoro dei data engineer, e accanto ad esse il loro valore per le offerte di lavoro per data scientist.

Raccomandazioni
Se vuoi dedicarti al data engineering, ti consiglio di acquisire familiarità con le seguenti tecnologie – le elenco in ordine di priorità approssimativa.
Studia SQL. Ti consiglio PostgreSQL, poiché ha codice aperto, è molto popolare nella comunità ed è in fase di crescita. Come utilizzare il linguaggio, puoi scoprirlo nel libro My Memorable SQL – la sua versione pilota è disponibile .
Impara Python, senza dover essere un esperto. Il libro My Memorable Python è progettato proprio per i principianti. Puoi acquistarlo su , in formato elettronico o cartaceo, a tua scelta, oppure scaricarlo in formato pdf o epub .
Una volta che hai familiarità con Python, passa a pandas – la libreria Python utilizzata per la pulizia e l'elaborazione dei dati. Se aspiri a lavorare in un'azienda che richiede competenze in Python (e la maggior parte lo fa), puoi essere certo che la conoscenza di pandas sarà presupposta. Sto attualmente completando una guida introduttiva per lavorare con pandas – puoi , per non perdere il momento della pubblicazione.
Impara AWS. Se desideri diventare un data engineer, non puoi fare a meno di avere una piattaforma cloud a disposizione, e AWS è la più popolare tra queste. I corsi mi sono stati molto utili quando studiavo , penso che anche su AWS abbiano buoni materiali.
Se hai già affrontato tutta questa lista e vuoi crescere ulteriormente agli occhi dei datori di lavoro come data engineer, ti consiglio di aggiungere Apache Spark per lavorare con grandi dati. Anche se la mia ricerca sulle offerte di lavoro per data science ha mostrato un calo di interesse, tra i data engineer appare ancora in quasi ogni seconda offerta.
Per finire
Spero che questa panoramica delle tecnologie più richieste per data engineer ti sia stata utile. Se sei interessato a come stanno le cose nelle offerte per analisti, leggi . Buona ingegneria!
Fonte: habr.com
