{"id":34083,"date":"2019-10-31T21:56:19","date_gmt":"2019-10-31T18:56:19","guid":{"rendered":"https:\/\/prohoster.info\/blog\/kto-takie-data-inzhenery-i-kak-imi-stanovyatsya\/"},"modified":"2019-10-31T21:56:19","modified_gmt":"2019-10-31T18:56:19","slug":"kto-takie-data-inzhenery-i-kak-imi-stanovyatsya","status":"publish","type":"post","link":"https:\/\/prohoster.info\/it\/blog\/administrirovanie\/kto-takie-data-inzhenery-i-kak-imi-stanovyatsya","title":{"rendered":"Chi sono gli ingegneri dei dati e come si diventa tali?","gt_translate_keys":[{"key":"rendered","format":"text"}]},"content":{"rendered":"<p>E di nuovo buongiorno! Il titolo dell'articolo parla da s\u00e9. In previsione dell'inizio del corso <noindex><a rel=\"nofollow\" href=\"https:\/\/otus.pw\/a4Uj\/\">\u00abData Engineer\u00bb<\/a><\/noindex> proponiamo di capire chi siano davvero gli ingegneri dei dati. L'articolo contiene molti link utili. Buona lettura.<\/p>\n<p><img decoding=\"async\" alt=\"Chi sono gli ingegneri dei dati e come si diventa tali?\" src=\"\/wp-content\/uploads\/2019\/05\/5f831df35ab1292adafca20f937ed22d.png\" style=\"display:block;margin: 0 auto;\" \/><br \/>\n<br \/>\n<i>Una guida semplice su come cavalcare l'onda dell'ingegneria dei dati e non lasciarsi trascinare nell'abisso.<\/i><\/p>\n<p>Sembra che oggigiorno tutti vogliano diventare scienziati dei dati (Data Scientist). Ma che dire dell'ingegneria dei dati? <i>In sostanza, si tratta di una sorta di ibrido tra analista di dati e scienziato dei dati; l'ingegnere dei dati \u00e8 solitamente responsabile della gestione dei flussi di lavoro, dei pipeline di elaborazione e dei processi ETL.<\/i>Data l'importanza di queste funzioni, al momento \u00e8 un altro gergo professionale molto popolare che sta guadagnando terreno.<\/p>\n<p>Un alto stipendio e una grande domanda sono solo una piccola parte di ci\u00f2 che rende questo lavoro estremamente attraente! Se desideri unirti ai ranghi degli eroi, non \u00e8 mai troppo tardi per iniziare a studiare. In questo post ho raccolto tutte le informazioni necessarie per aiutarti a fare i primi passi.<\/p>\n<p>Quindi, iniziamo!<noindex><a rel=\"nofollow\" name=\"habracut\"><\/a><\/noindex><\/p>\n<p><b>Cos'\u00e8 l'ingegneria dei dati?<\/b><\/p>\n<p>Onestamente, non c'\u00e8 spiegazione migliore di questa:<\/p>\n<blockquote><p><i>\"Uno scienziato pu\u00f2 scoprire una nuova stella, ma non pu\u00f2 crearla. Dovr\u00e0 chiedere a un ingegnere di farlo per lui.\"<\/i><\/p>\n<p>\u2013 Gordon Lindsey Glegg<\/p><\/blockquote>\n<p>Pertanto, il ruolo dell'ingegnere dei dati \u00e8 piuttosto significativo.<\/p>\n<p>Dal nome si evince che l'ingegneria dei dati \u00e8 legata ai dati, precisamente alla loro consegna, archiviazione e lavorazione. Di conseguenza, il compito principale degli ingegneri \u00e8 garantire un'infrastruttura dati affidabile. Se osserviamo la gerarchia dei bisogni dell'IA, l'ingegneria dei dati occupa i primi 2-3 livelli: <b>raccolta, spostamento e archiviazione, preparazione dei dati<\/b>.<\/p>\n<p><img decoding=\"async\" alt=\"Chi sono gli ingegneri dei dati e come si diventa tali?\" src=\"\/wp-content\/uploads\/2019\/05\/377481f2f52a4ed771508a450678afd0.png\" style=\"display:block;margin: 0 auto;\" \/><br \/>\n<br \/>\n<b>Cosa fa un ingegnere dei dati?<\/b><\/p>\n<p>Con l'emergere dei big data, l'ambito di responsabilit\u00e0 \u00e8 cambiato radicalmente. Se in passato questi esperti scrivevano grandi query SQL e trasferivano dati utilizzando strumenti come Informatica ETL, Pentaho ETL, Talend, oggi le richieste per gli ingegneri dei dati sono aumentate.<\/p>\n<p>La maggior parte delle aziende con posizioni aperte per ingegneri dei dati richiede i seguenti requisiti:<\/p>\n<ul>\n<li>Ottima conoscenza di SQL e Python.<\/li>\n<li>Esperienza con piattaforme cloud, in particolare Amazon Web Services.<\/li>\n<li>Preferibile conoscenza di Java\/Scala.<\/li>\n<li>Buona comprensione dei database SQL e NoSQL (modellazione dei dati, archiviazione dei dati).<\/li>\n<\/ul>\n<p>Tieni presente che questo \u00e8 solo il necessario. Da questa lista si pu\u00f2 dedurre che gli ingegneri dei dati sono specialisti nello sviluppo software e nel backend.<br \/>\nAd esempio, se un'azienda inizia a generare un grande volume di dati da diverse fonti, il tuo compito come ingegnere dei dati \u00e8 organizzare la raccolta delle informazioni, il loro trattamento e la loro archiviazione.<\/p>\n<p>La lista degli strumenti utilizzati in questo caso pu\u00f2 variare, tutto dipende dal volume di questi dati, dalla velocit\u00e0 con cui arrivano e dalla loro eterogeneit\u00e0. La maggior parte delle aziende non affronta affatto grandi dati, quindi come magazzino centralizzato, il cosiddetto data warehouse, \u00e8 possibile utilizzare un database SQL (PostgreSQL, MySQL, ecc.) con un insieme ridotto di script che indirizzano i dati verso il magazzino.<\/p>\n<p>I giganti IT come Google, Amazon, Facebook o Dropbox hanno requisiti pi\u00f9 elevati: conoscenza di Python, Java o Scala.<\/p>\n<ul>\n<li>Esperienza con grandi dati: Hadoop, Spark, Kafka.<\/li>\n<li>Conoscenza di algoritmi e strutture dati.<\/li>\n<li>Comprensione delle basi dei sistemi distribuiti.<\/li>\n<li>L'esperienza con strumenti di visualizzazione dei dati, come Tableau o ElasticSearch, sar\u00e0 un grande vantaggio.<\/li>\n<\/ul>\n<p>Si osserva quindi un chiaro spostamento verso i grandi dati, in particolare nel loro trattamento sotto carichi elevati. Queste aziende hanno requisiti elevati per la resilienza del sistema.<\/p>\n<p><b>Ingegneri dei dati vs. scienziati dei dati<\/b><\/p>\n<p><img decoding=\"async\" alt=\"Chi sono gli ingegneri dei dati e come si diventa tali?\" src=\"\/wp-content\/uploads\/2019\/05\/f01dd66863fcc0a89ab0b763d208a863.png\" style=\"display:block;margin: 0 auto;\" \/><br \/>\n<i>Va bene, \u00e8 stata una semplice e divertente comparazione (niente di personale), ma in realt\u00e0 le cose sono molto pi\u00f9 complesse.<\/i><\/p>\n<p>Prima di tutto, devi sapere che c'\u00e8 una certa confusione nella delimitazione dei ruoli e delle competenze tra scienziato dei dati e ingegnere dei dati. Vale a dire, puoi facilmente essere confuso riguardo a quali competenze siano necessarie per essere un ingegnere dei dati di successo. Certo, ci sono alcune competenze che si sovrappongono tra i due ruoli. Ma ci sono anche una serie di competenze diametralmente opposte.<\/p>\n<p>La scienza dei dati \u00e8 una questione seria, ma ci stiamo muovendo verso un mondo di data science funzionale, dove i praticanti sono in grado di effettuare la propria analisi. Per attivare pipeline di dati e strutture dati integrate, ti servono ingegneri dei dati, non scienziati.<\/p>\n<p><b>\u00c8 un data engineer pi\u00f9 richiesto di un data scientist?<\/b><\/p>\n<blockquote><p><i> \u2014 S\u00ec, perch\u00e9 prima di poter preparare una torta di carote, devi prima raccogliere, pulire e rifornire di carote!<\/i><\/p><\/blockquote>\n<p>Il data engineer conosce la programmazione meglio di qualsiasi data scientist, ma quando si tratta di statistiche, \u00e8 tutto esattamente il contrario.<\/p>\n<p>Ma qui c'\u00e8 il vantaggio del data engineer:<\/p>\n<p>senza di lui\/lei, il valore del modello prototipo, che spesso consiste in un frammento di codice di scarsa qualit\u00e0 in un file Python, ottenuto dal data scientist e in qualche modo in grado di dare un risultato, tende a zero.<\/p>\n<p>Senza il data engineer, quel codice non diventer\u00e0 mai un progetto e nessun problema aziendale sar\u00e0 risolto efficacemente. Il data engineer cerca di trasformare tutto questo in un prodotto.<\/p>\n<p><b>Fondamentali che un data engineer deve conoscere<\/b><\/p>\n<p><img decoding=\"async\" alt=\"Chi sono gli ingegneri dei dati e come si diventa tali?\" src=\"\/wp-content\/uploads\/2019\/05\/f724004e5a30a0c021c4377d66985d16.png\" style=\"display:block;margin: 0 auto;\" \/><br \/>\n<br \/>\nQuindi, se questo lavoro ti accende e sei pieno di entusiasmo \u2014 puoi impararlo, puoi acquisire tutte le competenze necessarie e diventare una vera rock star nel campo dello sviluppo dati. E s\u00ec, puoi farlo anche senza competenze di programmazione o altre conoscenze tecniche. \u00c8 difficile, ma possibile!<\/p>\n<p><b>Quali sono i primi passi?<\/b><\/p>\n<blockquote><p><i>Devi avere un'idea generale di cosa sia cosa.<\/i><\/p><\/blockquote>\n<p>Innanzitutto, l'Ingegneria Dati appartiene all'informatica. In particolare, devi capire gli algoritmi e le strutture dati efficienti. In secondo luogo, poich\u00e9 i data engineer lavorano con i dati, \u00e8 necessario comprendere i principi di funzionamento dei database e delle strutture sottostanti.<\/p>\n<p>Ad esempio, i normali database SQL basati su B-tree sono fondati sulla struttura dati B-Tree e, nei moderni repository distribuiti, sugli LSM-Tree e altre modifiche delle tabelle hash.<\/p>\n<p><i>* Questi passaggi si basano su un articolo straordinario <noindex><a rel=\"nofollow\" href=\"https:\/\/medium.com\/@adil_45422\">di Adil Khashtamov<\/a><\/noindex>. Quindi, se conosci il russo, supporta questo autore e leggi <noindex><a rel=\"nofollow\" href=\"https:\/\/khashtamov.com\/ru\/data-engineer\/\">il suo post<\/a><\/noindex>.<\/i><\/p>\n<p><b>1. Algoritmi e strutture dati<\/b><\/p>\n<p>Utilizzare la giusta struttura dati pu\u00f2 migliorare notevolmente le prestazioni dell'algoritmo. Ideale sarebbe che tutti noi studiassimo le strutture dati e gli algoritmi nelle nostre scuole, ma questo viene raramente trattato. In ogni caso, non \u00e8 mai troppo tardi per informarsi.<br \/>\nQuindi, ecco i miei corsi gratuiti preferiti per studiare strutture dati e algoritmi:<\/p>\n<ul>\n<li><noindex><a rel=\"nofollow\" href=\"https:\/\/www.udemy.com\/introduction-to-data-structures\/?ranMID=39197&amp;ranEAID=JVFxdTr9V80&amp;ranSiteID=JVFxdTr9V80-fcVI3mDcwPC4Q5dpzDABSg&amp;LSNPUBID=JVFxdTr9V80\">Dal semplice al complesso: Strutture Dati (Udemy)<\/a><\/noindex><\/li>\n<li><noindex><a rel=\"nofollow\" href=\"https:\/\/www.coursera.org\/learn\/algorithms-part1?ranMID=40328&amp;ranEAID=JVFxdTr9V80&amp;ranSiteID=JVFxdTr9V80-Y2SOzvEQ5UCqGZ8SQ8yPFA&amp;siteID=JVFxdTr9V80-Y2SOzvEQ5UCqGZ8SQ8yPFA&amp;utm_content=10&amp;utm_medium=partners&amp;utm_source=linkshare&amp;utm_campaign=JVFxdTr9V80\">Algoritmi, Parte I (Coursera)<\/a><\/noindex><\/li>\n<li><noindex><a rel=\"nofollow\" href=\"https:\/\/www.coursera.org\/learn\/algorithms-part2?ranMID=40328&amp;ranEAID=JVFxdTr9V80&amp;ranSiteID=JVFxdTr9V80-sXWvgPKRyzYEBJ33lVooUQ&amp;siteID=JVFxdTr9V80-sXWvgPKRyzYEBJ33lVooUQ&amp;utm_content=10&amp;utm_medium=partners&amp;utm_source=linkshare&amp;utm_campaign=JVFxdTr9V80\">Algoritmi, Parte II (Coursera)<\/a><\/noindex>\n <\/li>\n<\/ul>\n<p>Inoltre, non dimenticate il lavoro classico sugli algoritmi di Thomas H. Cormen \u2014 <noindex><a rel=\"nofollow\" href=\"https:\/\/www.amazon.com\/gp\/product\/0262033844\/ref=as_li_tl?ie=UTF8&amp;camp=1789&amp;creative=9325&amp;creativeASIN=0262033844&amp;linkCode=as2&amp;tag=adilkhash-20&amp;linkId=74742875db503b1a899ca35159749067\">Introduzione agli algoritmi<\/a><\/noindex>. \u00c8 un ottimo manuale quando avete bisogno di rinfrescare la memoria.<\/p>\n<ul>\n<li>Per migliorare le vostre competenze, utilizzate <noindex><a rel=\"nofollow\" href=\"https:\/\/leetcode.com\/problemset\/algorithms\/\">Leetcode<\/a><\/noindex>.<\/li>\n<\/ul>\n<p>Potete anche immergervi nel mondo dei database con i fantastici video dell'Universit\u00e0 Carnegie Mellon su Youtube:<\/p>\n<ul>\n<li><noindex><a rel=\"nofollow\" href=\"https:\/\/www.youtube.com\/playlist?list=PLSE8ODhjZXjYutVzTeAds8xUt1rcmyT7x\">Introduzione ai sistemi di database<\/a><\/noindex>.<\/li>\n<li><noindex><a rel=\"nofollow\" href=\"https:\/\/www.youtube.com\/playlist?list=PLSE8ODhjZXja7K1hjZ01UTVDnGQdx5v5U\">Sistemi di database avanzati<\/a><\/noindex>.<\/li>\n<\/ul>\n<p><b>2. Studio di SQL<\/b><\/p>\n<p>La nostra vita \u00e8 costituita da dati. E per estrarre questi dati da un database, bisogna \"parlare\" con loro in un'unica lingua.<\/p>\n<p>SQL (Structured Query Language \u2014 linguaggio di interrogazione strutturato) \u00e8 il linguaggio di comunicazione nel campo dei dati. Qualunque cosa si possa dire, SQL \u00e8 nato, vive e continuer\u00e0 a vivere a lungo.<\/p>\n<p>Se siete stati a lungo nello sviluppo, probabilmente avrete notato che le voci sulla prossima morte di SQL ricorrono periodicamente. Il linguaggio \u00e8 stato sviluppato all'inizio degli anni '70 ed \u00e8 ancora molto popolare tra analisti, sviluppatori e semplici appassionati.<br \/>\nSenza la conoscenza di SQL nell'ingegneria dei dati non si va da nessuna parte, poich\u00e9 inevitabilmente sar\u00e0 necessario creare query per estrarre dati. Tutti i moderni archivi di big data supportano SQL:<\/p>\n<ul>\n<li>Amazon Redshift<\/li>\n<li>HP Vertica<\/li>\n<li>Oracle<\/li>\n<li>SQL Server<\/li>\n<\/ul>\n<p>\u2026 e molte altre.<\/p>\n<p>Per analizzare grandi volumi di dati memorizzati in sistemi distribuiti, come HDFS, sono stati inventati meccanismi SQL: Apache Hive, Impala e cos\u00ec via. Vedete, non sta andando da nessuna parte.<\/p>\n<p>Come imparare SQL? Praticandolo.<\/p>\n<p>A questo proposito, vi consiglio di dare un'occhiata a un ottimo libro di testo, che peraltro \u00e8 gratuito, di <noindex><a rel=\"nofollow\" href=\"https:\/\/mode.com\/sql-tutorial\/introduction-to-sql\/\">Mode Analytics<\/a><\/noindex>.<\/p>\n<ol>\n<li><noindex><a rel=\"nofollow\" href=\"https:\/\/www.datacamp.com\/courses\/intermediate-sql\/\">Livello intermedio di SQL<\/a><\/noindex><\/li>\n<li><noindex><a rel=\"nofollow\" href=\"https:\/\/www.datacamp.com\/courses\/joining-data-in-postgresql\">Unire dati in SQL<\/a><\/noindex><\/li>\n<\/ol>\n<p>Una caratteristica distintiva di questi corsi \u00e8 la presenza di un ambiente interattivo in cui \u00e8 possibile scrivere ed eseguire query SQL direttamente nel browser. La risorsa <noindex><a rel=\"nofollow\" href=\"https:\/\/modern-sql.com\/\">Modern SQL<\/a><\/noindex> non sar\u00e0 superflua. E potete applicare queste conoscenze in <noindex><a rel=\"nofollow\" href=\"https:\/\/leetcode.com\/problemset\/database\/\">esercizi di Leetcode<\/a><\/noindex> nella sezione Database.<\/p>\n<p><b>3. Programmazione in Python e Java\/Scala<\/b><\/p>\n<p>Perch\u00e9 vale la pena studiare il linguaggio di programmazione Python, ne ho gi\u00e0 parlato nell'articolo <noindex><a rel=\"nofollow\" href=\"https:\/\/medium.com\/datadriveninvestor\/python-vs-r-choosing-the-best-tool-for-ai-ml-data-science-7e0c2295e243\">Python vs R. Scegliere il miglior strumento per AI, ML e Data Science<\/a><\/noindex>. Per quanto riguarda Java e Scala, la maggior parte degli strumenti per l'archiviazione e l'elaborazione di enormi volumi di dati sono scritti in questi linguaggi. Ad esempio:<\/p>\n<ul>\n<li>Apache Kafka (Scala)<\/li>\n<li>Hadoop, HDFS (Java)<\/li>\n<li>Apache Spark (Scala)<\/li>\n<li>Apache Cassandra (Java)<\/li>\n<li>HBase (Java)<\/li>\n<li>Apache Hive (Java)<\/li>\n<\/ul>\n<p>Per capire come funzionano questi strumenti, \u00e8 necessario conoscere i linguaggi in cui sono scritti. L'approccio funzionale di Scala consente di affrontare in modo efficace i problemi di elaborazione parallela dei dati. Sfortunatamente, Python non pu\u00f2 vantare la stessa velocit\u00e0 e capacit\u00e0 di elaborazione parallela. In generale, conoscere pi\u00f9 linguaggi e paradigmi di programmazione influisce positivamente sulla variet\u00e0 degli approcci nella risoluzione dei problemi.<\/p>\n<p>Per immergerti nel linguaggio Scala, puoi leggere <noindex><a rel=\"nofollow\" href=\"https:\/\/www.amazon.com\/gp\/product\/0981531687\/ref=as_li_tl?ie=UTF8&amp;camp=1789&amp;creative=9325&amp;creativeASIN=0981531687&amp;linkCode=as2&amp;tag=adilkhash-20&amp;linkId=69314619f1e546e3921eb97c72cf4850\">Programmazione in Scala<\/a><\/noindex> dall'autore del linguaggio. Inoltre, la compagnia Twitter ha pubblicato una buona guida introduttiva \u2014 <noindex><a rel=\"nofollow\" href=\"https:\/\/twitter.github.io\/scala_school\/\">Scala School<\/a><\/noindex>.<\/p>\n<p>Per quanto riguarda Python, credo che <noindex><a rel=\"nofollow\" href=\"https:\/\/www.amazon.com\/gp\/product\/1491946008\/ref=as_li_tl?ie=UTF8&amp;camp=1789&amp;creative=9325&amp;creativeASIN=1491946008&amp;linkCode=as2&amp;tag=adilkhash-20&amp;linkId=8a663e966770c24874e323133cc7a005\">Fluent Python<\/a><\/noindex> sia il miglior libro di livello intermedio.<\/p>\n<p><b>4. Strumenti per il lavoro con i big data<\/b><\/p>\n<p>Ecco un elenco degli strumenti pi\u00f9 popolari nel mondo dei big data:<\/p>\n<ul>\n<li>Apache Spark<\/li>\n<li>Apache Kafka<\/li>\n<li>Apache Hadoop (HDFS, HBase, Hive)<\/li>\n<li>Apache Cassandra<\/li>\n<\/ul>\n<p>Ulteriori informazioni sulla costruzione di grandi blocchi di dati possono essere trovate in questo straordinario <noindex><a rel=\"nofollow\" href=\"http:\/\/xyz.insightdataengineering.com\/blog\/pipeline_map\/\">ambiente interattivo<\/a><\/noindex>. Gli strumenti pi\u00f9 popolari sono Spark e Kafka. Vale assolutamente la pena studiarli, meglio ancora se si comprende come funzionano internamente. Jay Kreps (co-autore di Kafka) ha pubblicato nel 2013 un lavoro monumentale <noindex><a rel=\"nofollow\" href=\"https:\/\/engineering.linkedin.com\/distributed-systems\/log-what-every-software-engineer-should-know-about-real-time-datas-unifying\">The Log: cosa ogni sviluppatore di software deve sapere sull'astrazione della fusione dei dati in tempo reale<\/a><\/noindex>, peraltro, le idee fondamentali di questo talmud sono state utilizzate per la creazione di Apache Kafka.<\/p>\n<ul>\n<li>Un'introduzione a Hadoop pu\u00f2 essere <noindex><a rel=\"nofollow\" href=\"https:\/\/data-flair.training\/blogs\/hadoop-tutorials-home\/\">Guida completa per imparare Hadoop (gratuita)<\/a><\/noindex>.<\/li>\n<li>Per me, la guida pi\u00f9 completa su Apache Spark \u00e8 <noindex><a rel=\"nofollow\" href=\"https:\/\/www.amazon.com\/gp\/product\/1491912219\/ref=as_li_tl?ie=UTF8&amp;camp=1789&amp;creative=9325&amp;creativeASIN=1491912219&amp;linkCode=as2&amp;tag=adilkhash-20&amp;linkId=5b206424060cfc80a33d13b05c0bfee2\">Spark: guida completa<\/a><\/noindex>.<\/li>\n<\/ul>\n<p><b>5. Piattaforme cloud<\/b><\/p>\n<p><img decoding=\"async\" alt=\"Chi sono gli ingegneri dei dati e come si diventa tali?\" src=\"\/wp-content\/uploads\/2019\/05\/cc435bc9f9b91ec87d1cf7a591cf84a2.png\" style=\"display:block;margin: 0 auto;\" \/><br \/>\n<br \/>\nLa conoscenza di almeno una piattaforma cloud \u00e8 tra i requisiti di base richiesti per i candidati alla posizione di data engineer. I datori di lavoro preferiscono Amazon Web Services, al secondo posto c'\u00e8 la piattaforma cloud di Google, e chiude la classifica Microsoft Azure.<\/p>\n<p>Dovete avere una buona familiarit\u00e0 con Amazon EC2, AWS Lambda, Amazon S3, DynamoDB.<\/p>\n<p><b>6. Sistemi distribuiti<\/b><\/p>\n<p>Lavorare con i big data implica l'uso di cluster di computer autonomi, la cui comunicazione avviene tramite rete. Pi\u00f9 grande \u00e8 il cluster, maggiore \u00e8 la probabilit\u00e0 di guasti nei suoi nodi. Per diventare un esperto nel campo dei dati, \u00e8 necessario comprendere i problemi e le soluzioni esistenti nei sistemi distribuiti. Questo campo \u00e8 antico e complesso.<\/p>\n<p>Andrew Tanenbaum \u00e8 considerato un pioniere in questo campo. Per coloro che non temono la teoria, consiglio il suo libro <noindex><a rel=\"nofollow\" href=\"https:\/\/www.amazon.com\/gp\/product\/1543057381\/ref=as_li_tl?ie=UTF8&amp;camp=1789&amp;creative=9325&amp;creativeASIN=1543057381&amp;linkCode=as2&amp;tag=adilkhash-20&amp;linkId=721aedeb23c313bc46a92c134c5baafa\">\u00abSistemi distribuiti\u00bb<\/a><\/noindex>, per i principianti potrebbe sembrare complesso, ma in realt\u00e0 ti aiuter\u00e0 a affinare le tue competenze.<\/p>\n<p>Credo <noindex><a rel=\"nofollow\" href=\"https:\/\/www.amazon.com\/gp\/product\/1449373321\/ref=as_li_tl?ie=UTF8&amp;camp=1789&amp;creative=9325&amp;creativeASIN=1449373321&amp;linkCode=as2&amp;tag=adilkhash-20&amp;linkId=e7e0e096aa5761066245eb90965ac849\">che \u00abProgettazione di applicazioni ad alta intensit\u00e0 di dati\u00bb a cura di Martin Kleppmann<\/a><\/noindex> sia il miglior libro introduttivo. Tra l'altro, Martin ha un ottimo <noindex><a rel=\"nofollow\" href=\"https:\/\/martin.kleppmann.com\/\">blog<\/a><\/noindex>. Il suo lavoro aiuter\u00e0 a sistematizzare le conoscenze sulla costruzione dell'infrastruttura moderna per l'archiviazione e l'elaborazione di grandi dati.<br \/>\nPer chi ama guardare video, su Youtube c'\u00e8 un corso <noindex><a rel=\"nofollow\" href=\"https:\/\/www.youtube.com\/watch?v=w8KFPWkK0bI&amp;list=PLawkBQ15NDEkDJ5IyLIJUTZ1rRM9YQq6N&amp;index=2&amp;t=0s\">Sistemi informatici distribuiti<\/a><\/noindex>.<\/p>\n<p><b>7. Pipeline di dati<\/b><\/p>\n<p><img decoding=\"async\" alt=\"Chi sono gli ingegneri dei dati e come si diventa tali?\" src=\"\/wp-content\/uploads\/2019\/05\/cf1c8e2baad0cc79c0b8c3707741353a.png\" style=\"display:block;margin: 0 auto;\" \/><br \/>\n<br \/>\nLe pipeline di dati sono ci\u00f2 di cui non puoi fare a meno come ingegnere dei dati.<\/p>\n<p>La maggior parte del tempo, un ingegnere dei dati costruisce ci\u00f2 che viene chiamato pipeline di dati, cio\u00e8 crea un processo per la consegna dei dati da un luogo all'altro. Questi possono essere scenari utente che si connettono a un'API di un servizio esterno o eseguono una query SQL, arricchendo i dati e collocandoli in un'archiviazione centralizzata (data warehouse) o in un'archiviazione di dati non strutturati (data lake).<\/p>\n<p><b>In sintesi: la checklist principale per un ingegnere dei dati<\/b><\/p>\n<p><img decoding=\"async\" alt=\"Chi sono gli ingegneri dei dati e come si diventa tali?\" src=\"\/wp-content\/uploads\/2019\/05\/de0eca662b2246e63901afb89c9f255f.png\" style=\"display:block;margin: 0 auto;\" \/><br \/>\n<br \/>\nRiassumendo, \u00e8 necessario avere una buona comprensione dei seguenti aspetti:<\/p>\n<ul>\n<li>Sistemi informativi;<\/li>\n<li>Sviluppo software (Agile, DevOps, Tecniche di design, SOA);<\/li>\n<li>Sistemi distribuiti e programmazione parallela;<\/li>\n<li>Fondamenti di database \u2014 pianificazione, progettazione, funzionamento e risoluzione dei problemi;<\/li>\n<li>Progettazione di esperimenti \u2014 A\/B test per dimostrare concetti, determinare l'affidabilit\u00e0, le prestazioni dei sistemi e per sviluppare percorsi affidabili per fornire buone soluzioni operativamente.<\/li>\n<\/ul>\n<p>Questi sono solo alcuni requisiti per diventare ingegnere dei dati, quindi studia e approfondisci i sistemi di dati, i sistemi informativi, la consegna continua\/implementazione\/integrazione, i linguaggi di programmazione e altri argomenti di informatica (non in tutte le aree tematiche).<\/p>\n<p><b>E, infine, l'ultima cosa, ma molto importante, che voglio dire.<\/b><\/p>\n<blockquote><p><i><b>Il percorso per diventare un Data Engineer non \u00e8 cos\u00ec semplice come pu\u00f2 sembrare. Non perdona, frustra e devi essere pronto a questo. Alcuni momenti in questo viaggio potrebbero spingerti a mollare tutto. Ma \u00e8 un vero e proprio lavoro e un processo di apprendimento.<\/b><\/i><\/p><\/blockquote>\n<p>Non mascherarlo fin dall'inizio. Il senso del viaggio \u00e8 imparare il pi\u00f9 possibile ed essere pronti ad affrontare nuove sfide.<br \/>\nEcco un'immagine interessante con cui sono rimasto colpito, che illustra bene questo concetto:<\/p>\n<p><img decoding=\"async\" alt=\"Chi sono gli ingegneri dei dati e come si diventa tali?\" src=\"\/wp-content\/uploads\/2019\/05\/9cc8db9011e5f54717d7e9f31f915523.png\" style=\"display:block;margin: 0 auto;\" \/><br \/>\n<br \/>\nE s\u00ec, non dimenticare di evitare il burnout e di riposarti. \u00c8 molto importante anche questo. Buona fortuna!<\/p>\n<p>Che ne pensate dell'articolo, amici? Vi invitiamo a <noindex><a rel=\"nofollow\" href=\"https:\/\/otus.pw\/RCuj\/\">un webinar gratuito<\/a><\/noindex>, che si terr\u00e0 oggi alle 20:00. Durante il webinar discuteremo di come costruire un sistema di elaborazione dati efficace e scalabile per una piccola azienda o un startup con costi minimi. In pratica, ci familiarizzeremo con gli strumenti di gestione dei dati di Google Cloud. A presto!<br \/>\n<br \/>Fonte: <a content=\"nofollow\" rel=\"nofollow\" href=\"https:\/\/habr.com\/ru\/company\/otus\/blog\/452670\/\">habr.com<\/a><\/p>","protected":false,"gt_translate_keys":[{"key":"rendered","format":"html"}]},"excerpt":{"rendered":"<p>\u0418 \u0441\u043d\u043e\u0432\u0430 \u0437\u0434\u0440\u0430\u0432\u0441\u0442\u0432\u0443\u0439\u0442\u0435! \u0417\u0430\u0433\u043e\u043b\u043e\u0432\u043e\u043a \u0441\u0442\u0430\u0442\u044c\u0438 \u0433\u043e\u0432\u043e\u0440\u0438\u0442 \u0441\u0430\u043c \u043e \u0441\u0435\u0431\u0435. \u0412 \u043f\u0440\u0435\u0434\u0434\u0432\u0435\u0440\u0438\u0438 \u0441\u0442\u0430\u0440\u0442\u0430 \u043a\u0443\u0440\u0441\u0430 \u00abData Engineer\u00bb \u043f\u0440\u0435\u0434\u043b\u0430\u0433\u0430\u0435\u043c \u0440\u0430\u0437\u043e\u0431\u0440\u0430\u0442\u044c\u0441\u044f \u0432 \u0442\u043e\u043c, \u043a\u0442\u043e \u0436\u0435 \u0442\u0430\u043a\u0438\u0435 \u0434\u0430\u0442\u0430-\u0438\u043d\u0436\u0435\u043d\u0435\u0440\u044b. \u0412 \u0441\u0442\u0430\u0442\u044c\u0435 \u043e\u0447\u0435\u043d\u044c \u043c\u043d\u043e\u0433\u043e \u043f\u043e\u043b\u0435\u0437\u043d\u044b\u0445 \u0441\u0441\u044b\u043b\u043e\u043a. \u041f\u0440\u0438\u044f\u0442\u043d\u043e\u0433\u043e \u043f\u0440\u043e\u0447\u0442\u0435\u043d\u0438\u044f. \u041f\u0440\u043e\u0441\u0442\u043e\u0435 \u0440\u0443\u043a\u043e\u0432\u043e\u0434\u0441\u0442\u0432\u043e \u043e \u0442\u043e\u043c, \u043a\u0430\u043a \u043f\u043e\u0439\u043c\u0430\u0442\u044c \u0432\u043e\u043b\u043d\u0443 Data Engineering \u0438 \u043d\u0435 \u0434\u0430\u0442\u044c \u0435\u0439 \u0437\u0430\u0442\u044f\u043d\u0443\u0442\u044c \u0432\u0430\u0441 \u0432 \u043f\u0443\u0447\u0438\u043d\u0443. \u0421\u043a\u043b\u0430\u0434\u044b\u0432\u0430\u0435\u0442\u0441\u044f \u0432\u043f\u0435\u0447\u0430\u0442\u043b\u0435\u043d\u0438\u0435, \u0447\u0442\u043e \u0432 \u043d\u0430\u0448\u0438 \u0434\u043d\u0438 \u043a\u0430\u0436\u0434\u044b\u0439 [&hellip;]<\/p>\n","protected":false,"gt_translate_keys":[{"key":"rendered","format":"html"}]},"author":1,"featured_media":25729,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[688],"tags":[],"class_list":["post-34083","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-administrirovanie"],"aioseo_notices":[],"aioseo_head":"\n\t\t<!-- All in One SEO 5.0.1.1 - aioseo.com -->\n\t<meta name=\"description\" content=\"\u0418 \u0441\u043d\u043e\u0432\u0430 \u0437\u0434\u0440\u0430\u0432\u0441\u0442\u0432\u0443\u0439\u0442\u0435! \u0417\u0430\u0433\u043e\u043b\u043e\u0432\u043e\u043a \u0441\u0442\u0430\u0442\u044c\u0438 \u0433\u043e\u0432\u043e\u0440\u0438\u0442 \u0441\u0430\u043c \u043e \u0441\u0435\u0431\u0435.\" \/>\n\t<meta name=\"robots\" content=\"max-image-preview:large\" \/>\n\t<meta name=\"author\" content=\"Yuri Gagarin\"\/>\n\t<link rel=\"canonical\" href=\"https:\/\/prohoster.info\/it\/blog\/administrirovanie\/kto-takie-data-inzhenery-i-kak-imi-stanovyatsya\" \/>\n\t<meta name=\"generator\" content=\"All in One SEO (AIOSEO) 5.0.1.1\" \/>\n\t\t<meta property=\"og:locale\" content=\"it_IT\" \/>\n\t\t<meta property=\"og:site_name\" content=\"ProHoster | \u041a\u0443\u043f\u0438\u0442\u044c \u043d\u0430\u0434\u0435\u0436\u043d\u044b\u0439 \u0445\u043e\u0441\u0442\u0438\u043d\u0433 \u0434\u043b\u044f \u0441\u0430\u0439\u0442\u043e\u0432 \u0441 \u0437\u0430\u0449\u0438\u0442\u043e\u0439 \u043e\u0442 DDoS, VPS VDS \u0441\u0435\u0440\u0432\u0435\u0440\u044b\" \/>\n\t\t<meta property=\"og:type\" content=\"article\" \/>\n\t\t<meta property=\"og:title\" content=\"\ud83e\udd47\u041a\u0442\u043e \u0442\u0430\u043a\u0438\u0435 \u0434\u0430\u0442\u0430-\u0438\u043d\u0436\u0435\u043d\u0435\u0440\u044b, \u0438 \u043a\u0430\u043a \u0438\u043c\u0438 \u0441\u0442\u0430\u043d\u043e\u0432\u044f\u0442\u0441\u044f? | ProHoster\" \/>\n\t\t<meta property=\"og:description\" content=\"\u0418 \u0441\u043d\u043e\u0432\u0430 \u0437\u0434\u0440\u0430\u0432\u0441\u0442\u0432\u0443\u0439\u0442\u0435! \u0417\u0430\u0433\u043e\u043b\u043e\u0432\u043e\u043a \u0441\u0442\u0430\u0442\u044c\u0438 \u0433\u043e\u0432\u043e\u0440\u0438\u0442 \u0441\u0430\u043c \u043e \u0441\u0435\u0431\u0435.\" \/>\n\t\t<meta property=\"og:url\" content=\"https:\/\/prohoster.info\/it\/blog\/administrirovanie\/kto-takie-data-inzhenery-i-kak-imi-stanovyatsya\" \/>\n\t\t<meta property=\"og:image\" content=\"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg\" \/>\n\t\t<meta property=\"og:image:secure_url\" content=\"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg\" \/>\n\t\t<meta property=\"og:image:width\" content=\"350\" \/>\n\t\t<meta property=\"og:image:height\" content=\"350\" \/>\n\t\t<meta property=\"article:published_time\" content=\"2019-10-31T18:56:19+00:00\" \/>\n\t\t<meta property=\"article:modified_time\" content=\"2019-10-31T18:56:19+00:00\" \/>\n\t\t<meta property=\"article:publisher\" content=\"https:\/\/www.facebook.com\/prohoster\" \/>\n\t\t<meta property=\"article:author\" content=\"https:\/\/www.facebook.com\/prohoster\" \/>\n\t\t<!-- All in One SEO -->\n\n","aioseo_head_json":{"title":"\ud83e\udd47Chi sono i Data Engineer e come si diventa tali? | ProHoster","description":"E di nuovo, bentornati! Il titolo dell'articolo parla da s\u00e9.","canonical_url":"https:\/\/prohoster.info\/it\/blog\/administrirovanie\/kto-takie-data-inzhenery-i-kak-imi-stanovyatsya","robots":"max-image-preview:large","keywords":"","webmasterTools":{"miscellaneous":""},"schema":null,"og:locale":"it_IT","og:site_name":"ProHoster | \u041a\u0443\u043f\u0438\u0442\u044c \u043d\u0430\u0434\u0435\u0436\u043d\u044b\u0439 \u0445\u043e\u0441\u0442\u0438\u043d\u0433 \u0434\u043b\u044f \u0441\u0430\u0439\u0442\u043e\u0432 \u0441 \u0437\u0430\u0449\u0438\u0442\u043e\u0439 \u043e\u0442 DDoS, VPS VDS \u0441\u0435\u0440\u0432\u0435\u0440\u044b","og:type":"article","og:title":"\ud83e\udd47\u041a\u0442\u043e \u0442\u0430\u043a\u0438\u0435 \u0434\u0430\u0442\u0430-\u0438\u043d\u0436\u0435\u043d\u0435\u0440\u044b, \u0438 \u043a\u0430\u043a \u0438\u043c\u0438 \u0441\u0442\u0430\u043d\u043e\u0432\u044f\u0442\u0441\u044f? | ProHoster","og:description":"\u0418 \u0441\u043d\u043e\u0432\u0430 \u0437\u0434\u0440\u0430\u0432\u0441\u0442\u0432\u0443\u0439\u0442\u0435! \u0417\u0430\u0433\u043e\u043b\u043e\u0432\u043e\u043a \u0441\u0442\u0430\u0442\u044c\u0438 \u0433\u043e\u0432\u043e\u0440\u0438\u0442 \u0441\u0430\u043c \u043e \u0441\u0435\u0431\u0435.","og:url":"https:\/\/prohoster.info\/it\/blog\/administrirovanie\/kto-takie-data-inzhenery-i-kak-imi-stanovyatsya","og:image":"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg","og:image:secure_url":"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg","og:image:width":350,"og:image:height":350,"article:published_time":"2019-10-31T18:56:19+00:00","article:modified_time":"2019-10-31T18:56:19+00:00","article:publisher":"https:\/\/www.facebook.com\/prohoster","article:author":"https:\/\/www.facebook.com\/prohoster"},"aioseo_meta_data":{"post_id":"34083","title":null,"description":null,"keywords":null,"keyphrases":null,"primary_term":null,"canonical_url":null,"og_title":null,"og_description":null,"og_object_type":"default","og_image_type":"default","og_image_url":null,"og_image_width":null,"og_image_height":null,"og_image_custom_url":null,"og_image_custom_fields":null,"og_video":null,"og_custom_url":null,"og_article_section":null,"og_article_tags":null,"twitter_use_og":false,"twitter_card":"default","twitter_image_type":"default","twitter_image_url":null,"twitter_image_custom_url":null,"twitter_image_custom_fields":null,"twitter_title":null,"twitter_description":null,"schema":{"blockGraphs":[],"customGraphs":[],"default":{"data":{"Article":[],"Course":[],"Dataset":[],"FAQPage":[],"Movie":[],"Person":[],"Product":[],"ProductReview":[],"Car":[],"Recipe":[],"Service":[],"SoftwareApplication":[],"WebPage":[]},"graphName":"","isEnabled":true},"graphs":[]},"schema_type":null,"schema_type_options":null,"pillar_content":false,"robots_default":true,"robots_noindex":false,"robots_noarchive":false,"robots_nosnippet":false,"robots_nofollow":false,"robots_noimageindex":false,"robots_noodp":false,"robots_notranslate":false,"robots_max_snippet":null,"robots_max_videopreview":null,"robots_max_imagepreview":"large","priority":null,"frequency":null,"local_seo":null,"seo_analyzer_scan_date":"2026-01-21 17:49:20","breadcrumb_settings":null,"limit_modified_date":false,"reviewed_by":null,"ai":null,"created":"2021-03-01 02:28:35","updated":"2026-01-21 17:49:20","focus_keyword":null,"additional_keywords":null,"truseo_locale":null},"gt_translate_keys":[{"key":"link","format":"url"}],"_links":{"self":[{"href":"https:\/\/prohoster.info\/it\/wp-json\/wp\/v2\/posts\/34083","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/prohoster.info\/it\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/prohoster.info\/it\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/prohoster.info\/it\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/prohoster.info\/it\/wp-json\/wp\/v2\/comments?post=34083"}],"version-history":[{"count":0,"href":"https:\/\/prohoster.info\/it\/wp-json\/wp\/v2\/posts\/34083\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/prohoster.info\/it\/wp-json\/wp\/v2\/media\/25729"}],"wp:attachment":[{"href":"https:\/\/prohoster.info\/it\/wp-json\/wp\/v2\/media?parent=34083"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/prohoster.info\/it\/wp-json\/wp\/v2\/categories?post=34083"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/prohoster.info\/it\/wp-json\/wp\/v2\/tags?post=34083"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}