Profesioni i Data Scientist dhe Data Engineer shpesh ngatĂ«rrohen. Ădo kompani ka specifikĂ«n e saj nĂ« punĂ«n me tĂ« dhĂ«nat, objektivat e ndryshme tĂ« analizĂ«s dhe paraqitjen e ndryshme se kush nga specialistĂ«t duhet tĂ« merret me caktimin e punĂ«s, prandaj kĂ«rkesat janĂ« gjithmonĂ« tĂ« ndryshme.Â
Po shqyrtojmë se në çfarë diference janë këta specialistë, cilat probleme të biznesit ata zgjidhin, cilat aftësi kanë dhe sa fitojnë. Materiali doli të jetë i gjerë, prandaj e ndamë atë në dy publikime.
Në artikullin e parë, Elena Gerasimova, shefe e fakultetit "" në Netology, tregon se cila është diferenca midis Data Scientist dhe Data Engineer dhe me cilat mjete ata punojnë.
Si diferencohen rolet e inxhinierëve dhe shkencëtarëve të të dhënave
Inxhinieri i të dhënave është një specialist që, nga njëra anë, zhvillon, teston dhe mban infrastrukturën për punën me të dhënat: bazat e të dhënave, magazinat dhe sistemet e përpunimit masiv. Nga ana tjetër, ai është ai që pastron dhe "përgatit" të dhënat për t'u përdorur nga analistët dhe data scientist, dmth krijon konvikte për përpunimin e të dhënave.
Data Scientist krijon dhe trajnon modele parashikuese (dhe jo vetëm) duke përdorur algoritme të mësimit të makinerisë dhe rrjeteve nervore, duke i ndihmuar biznesit të gjejë rregulla të fshehta, të parashikojë zhvillimin e ngjarjeve dhe të optimizojë proceset kryesore të biznesit.
Diferenca kryesore midis Data Scientist dhe Data Engineer Ă«shtĂ« se zakonisht ata kanĂ« objektiva tĂ« ndryshme. TĂ« dy punojnĂ« pĂ«r tĂ« siguruar qĂ« tĂ« dhĂ«nat tĂ« jenĂ« tĂ« aksesueshme dhe cilĂ«sore. Por Data Scientist gjen pĂ«rgjigjet pĂ«r pyetjet e tij dhe verifikon hipotezat nĂ« ekosistemin e tĂ« dhĂ«nave (p.sh., nĂ« bazĂ«n Hadoop), ndĂ«rsa Data Engineer krijon njĂ« pipeline pĂ«r shĂ«rbimin e algoritmit tĂ« mĂ«simit tĂ« makinerisĂ« tĂ« shkruar nga data scientist nĂ« klasterin Spark brenda tĂ« njĂ«jtit ekosistem.Â
Inxhinieri i tĂ« dhĂ«nave sjell vlerĂ« pĂ«r biznesin duke punuar nĂ« ekip. Detyra e tij Ă«shtĂ« tĂ« jetĂ« njĂ« lidhje e rĂ«ndĂ«sishme midis palĂ«ve tĂ« ndryshme: nga zhvilluesit deri te konsumatorĂ«t e biznesit pĂ«r raportimin, dhe tĂ« rrisĂ« produktivitetin e analistĂ«ve â nga ata tĂ« marketingut e produktit deri te BI.Â
Data Scientist, përkundrazi, merr pjesë aktivisht në strategjinë e kompanisë dhe nxjerrjen e njohurive, marrjen e vendimeve, implementimin e algoritmeve të automatizimit, modelimit dhe gjenerimin e vlerës nga të dhënat.

Puna me tĂ« dhĂ«na i pĂ«rmbahet parimit GIGO (garbage in â garbage out): nĂ«se analistĂ«t dhe data scientist kanĂ« tĂ« bĂ«jnĂ« me tĂ« dhĂ«na tĂ« papĂ«rgatitura dhe potencialisht tĂ« pasakta, atĂ«herĂ« rezultatet, madje edhe me algoritmet mĂ« tĂ« sofistikuara tĂ« analizĂ«s, do tĂ« jenĂ« tĂ« gabuara.Â
InxhinierĂ«t e tĂ« dhĂ«nave zgjidhin kĂ«tĂ« problem duke ndĂ«rtuar pipeline pĂ«r pĂ«rpunimin, pastrimin dhe transformimin e tĂ« dhĂ«nave dhe duke lejuar data scientist tĂ« punojnĂ« me tĂ« dhĂ«na tĂ« cilĂ«sisĂ« sĂ« lartĂ«.Â
NĂ« treg ka shumĂ« mjete pĂ«r punĂ«n me tĂ« dhĂ«nat qĂ« mbulojnĂ« çdo etapĂ«: nga shfaqja e tĂ« dhĂ«nave deri te shfaqja nĂ« panelin pĂ«r kĂ«shillin e drejtorĂ«ve. Dhe Ă«shtĂ« e rĂ«ndĂ«sishme qĂ« vendimi pĂ«r pĂ«rdorimin e tyre tĂ« merret nga inxhinieri, â jo sepse Ă«shtĂ« nĂ« modĂ«, por sepse ai nĂ« tĂ« vĂ«rtetĂ« do tĂ« ndihmojĂ« pjesĂ«marrĂ«sit e tjerĂ« nĂ« proces.Â
Kushtimisht: nĂ«se kompanisĂ« i duhet tĂ« bashkojĂ« BI dhe ETL â ngarkimin e tĂ« dhĂ«nave dhe pĂ«rditĂ«simin e raporteve, kjo Ă«shtĂ« njĂ« themel tipik legacy qĂ« do t'i duhet tĂ« pĂ«rballet Data Engineer (e mira Ă«shtĂ« nĂ«se nĂ« ekip pĂ«rveç tij do tĂ« ketĂ« edhe njĂ« arkitekt).
Detyrat e Data Engineer
- Zhvillimi, ndërtimi dhe mbështetje e infrastrukturës për punën me të dhënat.
- Trajtimi i gabimeve dhe krijimi i pajisjeve të besueshme për përpunimin e të dhënave.
- Shndërrimi i të dhënave të pa strukturara nga burime të ndryshme dinamike në një formë të nevojshme për analistët.
- Ofro rekomandime për përmirësimin e koherencës dhe cilësisë së të dhënave.
- Sigurimi dhe mbështetje e arkitekturës së të dhënave, e cila përdoret nga data scientistët dhe analistët e të dhënave.
- Përpunimi dhe ruajtja e të dhënave në mënyrë të qëndrueshme dhe efikase në një kluster të shpërndarë me dhjetra ose qindra servera.
- Vlerësimi i kompromiseve teknike të mjeteve për krijimin e arkitekturave të thjeshta, por të besueshme, të cilat mund të përballojnë dështimet.
- Kontrolli dhe mbështetje e rrjedhave të të dhënave dhe sistemeve të lidhura (konfigurimi i monitorimit dhe alarmeve).
Ka edhe njĂ« specializim tjetĂ«r brenda trajektores sĂ« Data Engineer â inxhinieri i ML. NĂ«se e pĂ«rmbledhim, kĂ«ta inxhinierĂ« specializohen nĂ« sjelljen e modeleve tĂ« mĂ«simit tĂ« makinerisĂ« deri nĂ« implementimin dhe pĂ«rdorimin industrial. Shpesh, modeli qĂ« arrin nga data scientist Ă«shtĂ« njĂ« pjesĂ« e kĂ«rkimit dhe ndoshta nuk do tĂ« funksionojĂ« nĂ« kushte reale.
Detyrat e Data Scientist
- Nxjerrja e veçorive nga të dhënat për të aplikuar algoritmet e mësimit të makinerisë.
- Përdorimi i mjeteve të ndryshme të të mësuarit automatizuar për parashikimin dhe klasifikimin e modeleve në të dhëna.
- Rritja e performancës dhe saktësisë së algorimeve të të mësuarit automatizuar përmes optimizimit dhe rregullimit të hollësishëm të algorimeve.
- Formimi i hipotezave 'të forta' në përputhje me strategjinë e kompanisë që duhen verifikuar.
Si Data Engineer ashtu edhe Data Scientist kanë një kontribut të dukshëm në zhvillimin e kulturës së punës me të dhëna, e cila mundëson që kompania të gjenerojë fitime të mëdha ose të reduktojë shpenzimet.
Me cilat gjuhë dhe mjete punojnë inxhinierët dhe shkencëtarët e të dhënave
Sot, pritshmĂ«ritĂ« nga specialistĂ«t e pĂ«rpunimit tĂ« tĂ« dhĂ«nave janĂ« ndryshuar. Disa vite mĂ« parĂ«, inxhinierĂ«t pĂ«rgatisnin kĂ«rkesa tĂ« mĂ«dha SQL, shkruanin manualisht MapReduce dhe pĂ«rpunonin tĂ« dhĂ«nat duke pĂ«rdorur mjete si Informatica ETL, Pentaho ETL, Talend.Â
Në vitin 2020, specialistët nuk mund të kalojnë pa njohuri në Python dhe mjete moderne përllogaritjeje (për shembull, Airflow), si dhe kuptime të parimeve të punës me platforma cloud (përdorimi i tyre për kursimin e kostove të 'harduerëve', duke respektuar parimet e sigurisë).
SAP, Oracle, MySQL, Redis janĂ« mjete tradicionale pĂ«r inxhinierĂ«t e tĂ« dhĂ«nave nĂ« kompani tĂ« mĂ«dha. Ato janĂ« tĂ« mira, por kostoja e licencave Ă«shtĂ« aq e lartĂ« saqĂ« ka kuptim tĂ« mĂ«sohet pĂ«rdorimi i tyre vetĂ«m nĂ« projekte industriale. NĂ« tĂ« njĂ«jtĂ«n kohĂ«, egziston njĂ« alternativĂ« falas si Postgres â ai Ă«shtĂ« falas dhe i pĂ«rshtatshĂ«m pĂ«r mĂ«sim.Â

Historikisht, kërkesa për Java dhe Scala ka qenë e zakonshme, megjithatë me zhvillimin e teknologjive dhe qasjeve, këto gjuhë po kalojnë në plan të dytë.
MegjithatĂ«, Big Data e vĂ«rtetĂ«: Hadoop, Spark dhe njĂ« 'paku' tjetĂ«r, nuk janĂ« mĂ« njĂ« kusht i domosdoshĂ«m pĂ«r inxhinierĂ«t e tĂ« dhĂ«nave, por shembuj mjetesh pĂ«r zgjidhjen e problemeve qĂ« nuk mund tĂ« zgjidhen nga ETL tradicionale.Â
Trendi - shërbime për përdorimin e mjeteve pa njohuri të gjuhës në të cilën ato janë shkruar (për shembull, Hadoop pa njohuri në Java), si dhe ofrimi i shërbimeve të gatshme për përpunimin e të dhënave streaming (njohja e zërit ose imazheve në video).
Zgjidhjet industriale nga SAS dhe SPSS janë të njohura, ndërsa Tableau, Rapidminer, Stata dhe Julia gjithashtu përdoren gjerësisht nga shkencëtarët e të dhënave për çështje lokale.

MundĂ«sia pĂ«r tĂ« ndĂ«rtuar vetĂ« pipeline ka ekzistuar pĂ«r analistĂ«t dhe shkencĂ«tarĂ«t e tĂ« dhĂ«nave vetĂ«m disa vite mĂ« parĂ«: pĂ«r shembull, tani Ă«shtĂ« e mundur tĂ« drejtohen tĂ« dhĂ«nat nĂ« njĂ« depo bazuar nĂ« PostgreSQL duke pĂ«rdorur skripte relativisht tĂ« thjeshta.Â
Zakonisht, përdorimi i konvejeve dhe strukturave të integruara të të dhënave mbetet në dorë të inxhinierëve të të dhënave. Por sot, si kurrë më parë, është e fortë tendencia drejt specialistëve T-formë - me kompetenca të gjera në fushat e afërta, pasi mjetet po bëhen gjithnjë e më të thjeshta.
Pse Data Engineer dhe Data Scientist duhet të punojnë së bashku
Duke punuar ngushtë me inxhinierët, Data Scientist mund të fokusohen në pjesën hulumtuese, duke krijuar algoritme të gatshme për përdorim në të mësuarin automatizuar.
Dhe inxhinierët mund të përqendrohen në shkallëzueshmëri, ripërdorimin e të dhënave dhe të sigurojnë që konvejet e hyrjes dhe daljes së të dhënave në çdo projekt të veçantë të përputhen me arkitekturën globale.
Kjo ndarje e detyrave siguron njĂ« qĂ«ndrim tĂ« koherencĂ«s midis grupeve tĂ« specialistĂ«ve qĂ« punojnĂ« nĂ« projekte tĂ« ndryshme tĂ« tĂ« mĂ«suarit automatizuar.Â
BashkĂ«punimi ndihmon nĂ« krijimin efikas tĂ« produkteve tĂ« reja. ShpejtĂ«sia dhe cilĂ«sia arrihen pĂ«rmes njĂ« balancimi mes krijimit tĂ« njĂ« shĂ«rbimi pĂ«r tĂ« gjithĂ« (depo globale ose integrimi i panelit tĂ« kontrollit) dhe realizimin e çdo nevoje apo projekti tĂ« veçantĂ« (pipeline tĂ« specializuar, lidhja me burime tĂ« jashtme).Â
Puna e ngushtë me shkencëtarët e të dhënave dhe analistët ndihmon inxhinierët të zhvillojnë aftësi analitike dhe kërkimore për të shkruar më shumë kod të cilësisë. Përmirësohet shkëmbimi i njohurive midis përdoruesve të depozitave dhe liqeneve të të dhënave, duke bërë projektet më elastike dhe duke siguruar rezultate më të qëndrueshme në afat të gjatë.
NĂ« kompanitĂ« qĂ« kanĂ« si qĂ«llim zhvillimin e kulturĂ«s sĂ« punĂ«s me tĂ« dhĂ«na dhe ndĂ«rtimin e proceseve tĂ« biznesit mbi kĂ«tĂ« bazĂ«, Data Scientist dhe Data Engineer plotĂ«sojnĂ« njĂ«ri-tjetrin dhe krijojnĂ« njĂ« sistem tĂ« plotĂ« tĂ« analizĂ«s sĂ« tĂ« dhĂ«nave.Â
Në materialin e ardhshëm, do të flasim për arsimimin që duhet të kenë Data Engineer dhe Data Scientists, cilat aftësi duhet të zhvillojnë dhe si është tregu.
Nga redaksia e Netologjisë
Nëse po shqyrtoni profesionin e Data Engineer ose Data Scientist, ju ftojmë të shqyrtoni programet tona të kurseve:
- Profili "». Â
- Profili "».
Burimi: habr.com
