Le competenze più richieste nella professione di data engineer

Secondo statistiche del 2019, l'ingegnere dei dati è attualmente una professione la cui domanda cresce più rapidamente di tutte le altre. L'ingegnere dei dati svolge un ruolo critico nelle organizzazioni: crea e mantiene pipeline e database operativi utilizzati per l'elaborazione, la trasformazione e lo stoccaggio dei dati. Quali competenze sono necessarie ai professionisti di questo settore? La lista differisce da quella richiesta agli scienziati dei dati? Scoprirai tutto questo nel mio articolo.

Ho analizzato le offerte di lavoro per la posizione di ingegnere dei dati così come si presentano a gennaio 2020, per capire quali competenze tecnologiche sono più richieste. Ho poi confrontato i risultati con le statistiche delle offerte per la posizione di scienziato dei dati, rivelando alcune interessanti differenze.

Senza giri di parole, ecco le dieci tecnologie che vengono menzionate più frequentemente nei testi delle offerte di lavoro:

Le competenze più richieste nella professione di data engineer

Menzioni delle tecnologie nelle offerte per la posizione di ingegnere dei dati nel 2020

Analizziamo.

Responsabilità dell'ingegnere dei dati

Oggi, il lavoro svolto dai data engineer è di enorme importanza per le organizzazioni: sono queste persone a occuparsi dell'archiviazione delle informazioni e a prepararle affinché altri dipendenti possano lavorarci. I data engineer costruiscono pipeline per gestire l'acquisizione di dati, sia in streaming che in batch, da molteplici fonti. Le pipeline eseguono operazioni di estrazione, trasformazione e caricamento (in altre parole, i processi ETL), rendendo i dati più utilizzabili per successivi impieghi. Successivamente, i dati vengono forniti ad analisti e data scientist per un'analisi più approfondita. Infine, i dati terminano il loro viaggio su dashboard, report e modelli di machine learning.

Stavo cercando informazioni che potessero offrire un'indicazione sulle tecnologie più richieste nel lavoro di data engineer al momento attuale.

I metodi

Ho raccolto informazioni da tre siti web di ricerca lavoro — SimplyHired, Indeed e Monster e ho esaminato quali parole chiave sono associate a "data engineer" nei testi delle offerte di lavoro rivolte ai residenti negli Stati Uniti. Per questo compito, ho utilizzato due librerie Python — Requests e Beautiful Soup. Ho incluso parole chiave sia da precedenti elenchi per l'analisi delle offerte per la posizione di data scientist, sia quelle selezionate manualmente leggendo le offerte di lavoro per data engineer. LinkedIn non è stato incluso tra le fonti, poiché sono stato bannato dopo il mio ultimo tentativo di raccogliere dati.

Per ogni parola chiave, ho calcolato la percentuale di occorrenze rispetto al numero totale di testi su ciascun sito separatamente, e poi ho calcolato il valore medio tra le tre fonti.

Risultati

Di seguito sono riportati trenta termini tecnici nel campo del data engineering con i punteggi più alti su tutti e tre i siti di lavoro.

Le competenze più richieste nella professione di data engineer

Ecco gli stessi numeri, ma presentati in forma di tabella:

Le competenze più richieste nella professione di data engineer

Procediamo in ordine.

Panoramica dei risultati

Sia SQL che Python compaiono in più di due terzi delle offerte esaminate. Queste sono le due tecnologie che ha senso studiare per prime. Python – un linguaggio di programmazione molto popolare, utilizzato per lavorare con i dati, creare siti web e scrivere script. SQL significa linguaggio di query strutturato (SQL); rappresenta uno standard implementato da un gruppo di linguaggi e viene utilizzato per estrarre dati da database relazionali. È emerso molto tempo fa e ha dimostrato di avere una grande resilienza.

Di Spark si parla in circa metà delle offerte di lavoro. Apache Spark è "un motore analitico unificato per l'elaborazione dei big data con moduli integrati per il streaming, SQL, machine learning e elaborazione di grafi". È particolarmente popolare tra coloro che lavorano con database di grandi dimensioni.

AWS compare in circa il 45% dei testi delle offerte di lavoro. Questa è una piattaforma di calcolo cloud di Amazon; ha la quota di mercato più ampia tra tutte le piattaforme cloud.
Segue Java e Hadoop – poco più del 40% per ciascuno. Java è un linguaggio ampiamente utilizzato e collaudato, che si è evidenziato nel sondaggio degli sviluppatori di Stack Overflow del 2019. si è piazzato decimo tra i linguaggi che spaventano di più i programmatori. Al contrario, Python si è rivelato il secondo linguaggio maggiormente amato. Il linguaggio Java è gestito da Oracle, e tutto ciò che c'è da sapere può essere compreso da questo screenshot della pagina ufficiale risalente a gennaio 2020.

Le competenze più richieste nella professione di data engineer

Come se avessi fatto un viaggio nel tempo
Apache Hadoop utilizza il modello di programmazione MapReduce con cluster di server per gestire grandi dati. Attualmente, questo modello viene sempre più abbandonato.

Poi vediamo Hive, Scala, Kafka e NoSQL – ognuna di queste tecnologie è menzionata in un quarto delle offerte di lavoro presentate. Apache Hive è un programma di archiviazione dei dati che 'semplifica la lettura, la scrittura e la gestione di grandi set di dati situati in archivi distribuiti, utilizzando SQL.' Scala è un linguaggio di programmazione ampiamente utilizzato per lavorare con i big data. In particolare, Spark è stato sviluppato in Scala. Nella già menzionata classifica dei linguaggi spaventosi, Scala occupa l'undicesima posizione. Apache Kafka è una piattaforma distribuita per l'elaborazione di messaggi in streaming. È molto popolare come mezzo per la trasmissione di dati.

Database NoSQL si contrappongono a SQL. Si differenziano per il fatto di non essere relazionali, non strutturati e di avere una scalabilità orizzontale. NoSQL ha guadagnato una certa popolarità, ma la frenesia che circondava questo approccio, fino a profezie che avrebbe sostituito SQL come paradigma dominante di archiviazione, sembra ormai superata.

Confronto con i termini nelle offerte di lavoro per data scientist

Ecco trenta termini tecnologici più comuni tra i datori di lavoro nel settore della data science. Questo elenco l'ho ottenuto utilizzando lo stesso metodo descritto in precedenza per il data engineering.

Le competenze più richieste nella professione di data engineer

Menzioni di tecnologie nelle offerte di lavoro per la posizione di data scientist nel 2020

Parlando in termini assoluti, rispetto al set esaminato in precedenza, ci sono state il 28% di offerte in più (12.013 contro 9.396). Vediamo quali tecnologie appaiono nelle offerte per data scientist meno frequentemente rispetto a quelle per data engineer.

Più popolari nel data engineering

Nel grafico sottostante sono rappresentate le parole chiave con una differenza media nei valori superiore al 10% o inferiore al -10%.

Le competenze più richieste nella professione di data engineer

Le maggiori differenze nella frequenza delle parole chiave tra data engineer e data scientist

La crescita più significativa è registrata da AWS: nel data engineering appare con una frequenza superiore del 25% rispetto al data science (circa il 45% e il 20% del totale delle offerte di lavoro rispettivamente). La differenza è notevole!

Ecco gli stessi dati in una forma leggermente diversa: nel grafico, i risultati per la stessa parola chiave nelle offerte di lavoro per data engineer e data scientist sono affiancati.

Le competenze più richieste nella professione di data engineer

Le maggiori differenze nella frequenza delle parole chiave tra data engineer e data scientist

Il salto successivo più grande l'ho notato in Spark: il data engineer spesso deve lavorare con grandi volumi di dati. Kafka è aumentato anche del 20%, ovvero quasi quattro volte rispetto ai risultati delle offerte di lavoro per data scientist. La gestione dei dati è una delle principali responsabilità del data engineer. Infine, il numero di menzioni è stato maggiore del 15% nel data engineering per Java, NoSQL, Redshift, SQL e Hadoop.

Meno popolari nel data engineering

Ora diamo un'occhiata a quali tecnologie sono meno popolari nelle offerte di lavoro per data engineer.
Il calo più netto rispetto al data science è avvenuto per R: qui figurava in circa il 56% delle offerte, qui – solo nel 17%. Impressionante. R è un linguaggio di programmazione molto apprezzato tra scienziati e statistici e occupa l'ottavo posto nella classifica dei linguaggi più temuti.

SAS si trova anche nelle offerte di lavoro per la posizione di data engineer in misura significativamente inferiore: la differenza è del 14%. SAS è un linguaggio brevettato progettato per lavorare con statistiche e dati. Un punto interessante: a giudicare dai risultati della mia ricerca sulle offerte di lavoro per data scientist, ultimamente ha perso molto terreno – più di qualsiasi altra tecnologia.

Richieste sia in data engineering che in data science

Va notato che otto delle dieci posizioni principali in entrambi i set di dati coincidono. SQL, Python, Spark, AWS, Java, Hadoop, Hive e Scala sono entrati nella top ten sia per il settore data engineering che per la data science. Nella grafica qui sotto puoi vedere le quindici tecnologie più popolari tra i datori di lavoro dei data engineer, e accanto ad esse il loro valore per le offerte di lavoro per data scientist.

Le competenze più richieste nella professione di data engineer

Raccomandazioni

Se vuoi dedicarti al data engineering, ti consiglio di acquisire familiarità con le seguenti tecnologie – le elenco in ordine di priorità approssimativa.

Studia SQL. Ti consiglio PostgreSQL, poiché ha codice aperto, è molto popolare nella comunità ed è in fase di crescita. Come utilizzare il linguaggio, puoi scoprirlo nel libro My Memorable SQL – la sua versione pilota è disponibile qui.

Impara Python, senza dover essere un esperto. Il libro My Memorable Python è progettato proprio per i principianti. Puoi acquistarlo su Amazon, in formato elettronico o cartaceo, a tua scelta, oppure scaricarlo in formato pdf o epub su questo sito.

Una volta che hai familiarità con Python, passa a pandas – la libreria Python utilizzata per la pulizia e l'elaborazione dei dati. Se aspiri a lavorare in un'azienda che richiede competenze in Python (e la maggior parte lo fa), puoi essere certo che la conoscenza di pandas sarà presupposta. Sto attualmente completando una guida introduttiva per lavorare con pandas – puoi iscriversi, per non perdere il momento della pubblicazione.

Impara AWS. Se desideri diventare un data engineer, non puoi fare a meno di avere una piattaforma cloud a disposizione, e AWS è la più popolare tra queste. I corsi Linux Academymi sono stati molto utili quando studiavo data engineering su Google Cloud, penso che anche su AWS abbiano buoni materiali.

Se hai già affrontato tutta questa lista e vuoi crescere ulteriormente agli occhi dei datori di lavoro come data engineer, ti consiglio di aggiungere Apache Spark per lavorare con grandi dati. Anche se la mia ricerca sulle offerte di lavoro per data science ha mostrato un calo di interesse, tra i data engineer appare ancora in quasi ogni seconda offerta.

Per finire

Spero che questa panoramica delle tecnologie più richieste per data engineer ti sia stata utile. Se sei interessato a come stanno le cose nelle offerte per analisti, leggi il mio altro articolo. Buona ingegneria!

Fonte: habr.com

Acquista hosting affidabile per siti web con protezione DDoS, VPS VDS server 🔥 Acquista hosting affidabile per siti web con protezione DDoS, VPS VDS server | ProHoster