Andmeinsener ja Andmeanalüütik: mis vahe seal on?

Data Scientist ja Data Engineer'i ametid segi ajatakse sageli. Igal ettevõttel on oma andmetöötluse eripära, erinevad analüüsieesmärgid ja erinev arusaam, millised spetsialistid millist osa tööst peaksid tegema, mistõttu esitatakse ka erinevaid nõudmisi. 

Vaatame, milles need spetsialistid erinevad, milliseid äriülesandeid nad lahendavad, milliste oskustega nad valdavad ja kui palju nad teenivad. Materjal on ulatuslik, seetõttu jagasime selle kaheks väljaandeks.

Esimeses artiklis räägib Elena Gerasimova, "Andeteaduse ja analüütika" osakonna juht Netoloigis, milles seisneb erinevus Data Scientist'i ja Data Engineer'i vahel ning milliste tööriistadega nad töötavad.

Kuidas erinevad inseneride ja teadlaste rollid

Andmeinsener on spetsialist, kes, ühelt poolt, arendab, testib ja toetab andmetöötluse infrastruktuuri: andmebaasid, ladustamislahendused ja massiliseks töötlemiseks mõeldud süsteemid. Teiselt poolt on ta see, kes puhastab ja ‘korrastab’ andmeid analüütikute ja andeteadlastena kasutamiseks, st loob andmete töötlemise konveiere.

Data Scientist loob ja koolitab ennustavaid (ja mitte ainult) mudeleid masinõppe ja neurovõrkude algoritmide abil, aidates ettevõttel leida peidetud mustreid, prognoosida sündmuste arengut ja optimeerida võtmeäri protsesse.

Peamine erinevus Data Scientist'i ja Data Engineer'i vahel seisneb selles, et tavaliselt on neil erinevad eesmärgid. Mõlemad töötavad selle nimel, et andmed oleksid kergesti kättesaadavad ja kvaliteetsed. Kuid Data Scientist otsib vastuseid oma küsimustele ja kontrollib hüpoteese andmeökosüsteemis (näiteks Hadoopi baasil), samas kui Data Engineer loob masinõppe algoritmi teenindamiseks mõeldud andmevoo, mille on kirjutatud andeteadlane Spark'i klastris sama ökosüsteemi sees. 

Andmeinsener toob ettevõttele väärtust, töötades meeskonnas. Tema ülesanne on olla oluline lüli erinevate osaliste vahel: arendajatest äriaruannete tarbijateni — ja tõsta analüütikute tootlikkust — alates turundus- ja tooteanalüütikutest kuni BI-ni. 

Data Scientist, vastupidi, osaleb aktiivselt ettevõtte strateegias ja uuringutes, otsuste tegemisel, automatiseerimisalgoritmide rakendamisel, modelleerimisel ja andmetest väärtuse genereerimisel.
Andmeinsener ja Andmeanalüütik: mis vahe seal on?

Andmete töötlemine järgib GIGO (garbage in — garbage out) põhimõtteid: kui analüütikud ja andateadlased töötavad ettevalmistamata ja potentsiaalselt ebatäpsete andmetega, siis isegi kõige keerukamate analüüsialgoritmide abil saadud tulemused on vale. 

Andmeinsenerid lahendavad seda probleemi, ehitades andmete töötlemise, puhastamise ja transformeerimise torujuhtmeid, võimaldades andateadlasel töötada kvaliteetsete andmetega. 

Turul on palju andmeedastusvahendeid, mis katavad iga etapi: andmete ilmumisest kuni juhtkonna armatuurlaudade väljastamiseni. Oluline on, et nende kasutamise otsus teeks andmeinsener, — mitte seetõttu, et see oleks moes, vaid seetõttu, et see tõeliselt aitab teisi protsessi osalejaid. 

Ühest küljest: kui ettevõttel on vaja BI-d ja ETL-i — andmete laadimist ja aruannete värskendamist, siis on see tüüpiline pärandpõhi, millega peab tegelema andmeinsener (hea, kui tema meeskonnas on ka arhitekt).

Andmeinseneri kohustused

  • Andmeprotsesside infrastruktuuri arendamine, ülesehitamine ja hooldamine.
  • Vigade töötlemine ja usaldusväärsete andmete töötlemise voogude loomine.
  • Struktuurita andmete viimine erinevatest dünaamilistest allikatest analüütikutele vajalikku vormi.
  • Soovituste andmine andmete järjepidevuse ja kvaliteedi parandamiseks.
  • Andme- arsitekti toetamine ja haldamine, mida kasutavad andateadlased ja andmeanalüütikud.
  • Andmete töötlemine ja salvestamine järjestikuliselt ja tõhusalt hajutatud klastris kümnete või sadade serveritega.
  • Tööriistade tehniliste kompromisside hindamine, et luua lihtsaid, kuid usaldusväärseid arhitektuure, mis suudavad taluda rike.
  • Andmevoogude ja sellega seotud süsteemide jälgimine ja toetamine (monitooringu ja häirete seadistamine).

Andmeinseneri teekonna sees on veel üks eriala — ML- insener. Lihtsalt öeldes spetsialiseeruvad need insenerid masinõppemudelite viimisele tööstuslikku rakendamisse ja kasutamisse. Sageli on mudel, mis tuli andateadlase käest, osa uuringust ja ei pruugi tootmistingimustes hästi töötada.

Andmete teadlase kohustused

  • Andmetest tunnuste eraldamine masinõppe algoritmide rakendamiseks.
  • Erinevate masinõppe tööriistade kasutamine andmete mustrite prognoosimiseks ja klassifitseerimiseks.
  • Masinõppe algoritmide jõudluse ja täpsuse suurendamine tänu nende täpsustamisele ja optimeerimisele.
  • Tugevate hüpoteeside loomine vastavalt ettevõtte strateegiale, mida on vaja testida.

Data Engineer ja Data Scientist ühendab märgatav panus andmetöötluse kultuuri arengusse, mis võimaldab ettevõttel teenida lisatulu või vähendada kulusid.

Milliste keelte ja tööriistadega töötavad insenerid ja teadlased?

Täna on andmetöötlejate ootused muutunud. Varem koostasid insenerid suured SQL-päringud, kirjutasid käsitsi MapReduce ja töötlesid andmeid selliste tööriistadega nagu Informatica ETL, Pentaho ETL, Talend. 

2020. aastal ei saa spetsialist hakkama ilma Python'i ja kaasaegsete arvutustöötlusvahendite tundmiseta (näiteks Airflow), samuti pilveplatvormidega töötamise põhimõtete mõistmiseta (kasutades neid riistvara kulude kokkuhoiuks, järgides samas turvaperioode).

SAP, Oracle, MySQL, Redis on traditsioonilised andmeinseneri tööriistad suurtes ettevõtetes. Need on head, kuid litsentside kulud on nii kõrged, et nendega töötamist on mõistlik õppida ainult tööstusprojektides. Samas on olemas tasuta alternatiiv PostgreSQL - see on tasuta ja sobib mitte ainult õppimiseks. 

Andmeinsener ja Andmeanalüütik: mis vahe seal on?
Ajalooliselt on Java ja Scala päris sagedased nõudmised, kuigi tehnoloogia ja lähenemiste arenguga langevad need keeled tagaplaanile.

Siiski ei ole hardcore BigData: Hadoop, Spark ja ülejäänud zooloogia enam andmeinseneri jaoks kohustuslikud, vaid pigem vahendid ülesannete lahendamiseks, mida traditsioonilise ETL-iga ei suudeta lahendada. 

Trendiks on teenused tööriistade kasutamiseks ilma nende kirjutamise keele tundmata (näiteks Hadoop ilma Java tundmata), samuti valmis teenuste pakkumine vooluandmete töötlemiseks (häälte või videopiltide tuvastamine).

Tööstuslahendused SAS ja SPSS on populaarsed, samas on Tableau, Rapidminer, Stata ja Julia samuti laialdaselt kasutatavad andateadlaste seas kohalike ülesannete jaoks.

Andmeinsener ja Andmeanalüütik: mis vahe seal on?
Analüütikutele ja andeteadlastele avanes võimalus ise torujuhtmeid ehitada vaid paar aastat tagasi: näiteks on nüüd võimalik suhteliselt lihtsate skriptide abil suunata andmed PostgreSQL-põhisesse salvestusse. 

Tavaliselt jääb konveierite ja integreeritud andmestruktuuride kasutamine andmeinseneride valdusesse. Kuid täna on T-kujuliste spetsialistide trend, kellel on laiad oskused külgvaldkondades, eriti tugev, kuna tööriistad muutuvad pidevalt lihtsamaks.

Miks peaks Data Engineer ja Data Scientist koos töötama

Koostöös inseneridega saavad andeteadlased keskenduda uurimistööle, luues töökorras masinõppe algoritme.
Ja insenerid saavad keskenduda skaleeritavusele, andmete taaskasutusele ning tagama, et iga eraldi projekti andmete sisendi ja väljundi torujuhtmed vastavad globaalsetele arhitektuurinõuetele.

Selline rollide jaotus tagab tegevuste ühtsuse erinevates masinõppe projektides tegutsevate spetsialistide rühmades. 

Koostöö aitab tõhusalt luua uusi tooteid. Kiirus ja kvaliteet saavutatakse tänu tasakaalule kõigile teenuse loomise (globaalne salvestus või armatuurlaudade integreerimine) ja iga konkreetse vajaduse või projekti (kitsalt spetsialiseeritud torujuhe, väliste allikate ühendamine) rahuldamise vahel. 

Tihe koostöö andeteadlaste ja analüütikutega aitab inseneridel arendada analüütilisi ja uurimisoskusi, et kirjutada kvaliteetsemat koodi. Parandatakse teadmiste vahetust salvestuste ja andmejärvede kasutajate vahel, mistõttu projektid muutuvad paindlikumaks ning tagavad kauakestvamaid tulemusi.

Ettevõtetes, mis seavad eesmärgiks andmetega töötamise kultuuri arendamise ja äriprotsesside ülesehitamise nende alusel, täiendavad Data Scientist ja Data Engineer üksteist, luues tervikliku andmeanalüüsi süsteemi. 

Järgmises materjalis räägime sellest, milline haridus peaks olema Data Engineer'il ja Data Scientist'il, milliseid oskusi nad peaksid arendama ja kuidas turg on korraldatud.

Toimetusest Netology

Kui kaalute Data Engineer'i või Data Scientist'i ametit, kutsume teid tutvuma meie kursuste programmidega:

Allikas: habr.com

Osta usaldusväärne hostimine veebilehtede jaoks DDoS-i kaitsega, VPS VDS serverid 🔥 Osta usaldusväärne hostimine veebilehtede jaoks DDoS-i kaitsega, VPS VDS serverid | ProHoster