Profesionet Data Scientist dhe Data Engineer shpesh ngatĂ«rrohen. Ădo kompani ka specifikĂ«n e saj nĂ« punĂ«n me tĂ« dhĂ«nat, qĂ«llime tĂ« ndryshme tĂ« analizĂ«s dhe njĂ« pĂ«rfaqĂ«sim tĂ« ndryshĂ«m se cili specialist duhet tĂ« merret me çfarĂ« pune, prandaj, kĂ«rkesat qĂ« çdo kompani ka janĂ« tĂ« ndryshme.Â
Të kuptojmë se çfarë e ndan këta specialistë, çfarë probleme biznesi ata zgjidhin, çfarë aftësish kanë dhe sa fitojnë. Materiali doli të jetë i gjerë, prandaj e ndamë në dy publikime.
Në artikullin e parë, Elena Gerasimova, drejtore e fakultetit "" në Netology, flet për ndryshimin ndërmjet Data Scientist dhe Data Engineer dhe me cilat mjete ata punojnë.
Si dallohen rolet e inxhinierëve dhe scientistëve
Inxhinieri i të dhënave është specialisti që, nga njëra anë, zhvillon, teston dhe mirëmban infrastrukturën e punës me të dhëna: bazat e të dhënave, depozitimin dhe sistemet e përpunimit masiv. Nga ana tjetër, ai është ai që pastron dhe "përpunon" të dhënat për t'i përdorur nga analistët dhe data scientistët, që do të thotë se krijon linjat e përpunimit të të dhënave.
Data Scientist krijon dhe trajnon modele parashikuese (dhe jo vetëm) përmes algoritmeve të mësimit të makinerisë dhe rrjeteve nervore, duke ndihmuar biznesin të zbulojë shtigje të fshehura, të parashikojë zhvillimin e ngjarjeve dhe të optimizojë proceset kryesore të biznesit.
Kthesa kryesore ndĂ«rmjet Data Scientist dhe Data Engineer qĂ«ndron nĂ« faktin se zakonisht ata kanĂ« qĂ«llime tĂ« ndryshme. TĂ« dy punojnĂ« pĂ«r tĂ« siguruar qĂ« tĂ« dhĂ«nat tĂ« jenĂ« tĂ« disponueshme dhe tĂ« cilĂ«sisĂ« sĂ« lartĂ«. Por Data Scientist gjen pĂ«rgjigje pĂ«r pyetjet e tij dhe verifikon hipotezat nĂ« ekosistemin e tĂ« dhĂ«nave (pĂ«r shembull, mbi bazĂ«n Hadoop), ndĂ«rsa Data Engineer krijon pipeline pĂ«r mbĂ«shtetje tĂ« algoritmit tĂ« mĂ«simit tĂ« makinerisĂ«, i shkruar nga data scientist-i, nĂ« klasĂ«n Spark brenda tĂ« njĂ«jtit ekosistem.Â
Inxhinieri i tĂ« dhĂ«nave sjell vlerĂ« pĂ«r biznesin pĂ«rmes punĂ«s nĂ« ekip. Detyra e tij Ă«shtĂ« tĂ« luajĂ« njĂ« rol kyç midis pjesĂ«marrĂ«sve tĂ« ndryshĂ«m: nga zhvilluesit deri tek pĂ«rdoruesit biznesorĂ« tĂ« raporteve, dhe tĂ« rrisĂ« produktivitetin e analistĂ«ve - nga ata tĂ« marketingut dhe produkteve deri te BI.Â
Data Scientist, nga ana tjetër, merr një pjesëmarrje aktive në strategjinë e kompanisë dhe nxjerrjen e insight-eve, marrjen e vendimeve, implementimin e algoritmeve të automatizimit, modelimit dhe gjenerimin e vlerës nga të dhënat.

Puna me tĂ« dhĂ«nat i nĂ«nshtrohet parimit GIGO (garbage in â garbage out): nĂ«se analistĂ«t dhe shkencĂ«tarĂ«t e tĂ« dhĂ«nave punojnĂ« me tĂ« dhĂ«na tĂ« papĂ«rgatitura dhe potencialisht tĂ« gabuara, rezultatet, edhe me algoritmet mĂ« tĂ« avancuar tĂ« analizĂ«s, do tĂ« jenĂ« tĂ« gabuara.Â
InxhinierĂ«t e tĂ« dhĂ«nave e zgjidhin kĂ«tĂ« problem duke ndĂ«rtuar pipeline pĂ«r pĂ«rpunimin, pastrimin dhe transformimin e tĂ« dhĂ«nave, duke i lejuar shkencĂ«tarĂ«t e tĂ« dhĂ«nave tĂ« punojnĂ« me tĂ« dhĂ«na tĂ« cilĂ«sisĂ« mĂ« tĂ« lartĂ«.Â
NĂ« treg ka shumĂ« mjete pĂ«r punĂ«n me tĂ« dhĂ«nat, tĂ« cilat mbulojnĂ« çdo fazĂ«: nga shfaqja e tĂ« dhĂ«nave deri te paraqitja nĂ« dashboard pĂ«r bordin drejtues. E rĂ«ndĂ«sishme Ă«shtĂ« qĂ« vendimi pĂ«r pĂ«rdorimin e tyre tĂ« merret nga inxhinieri, â jo sepse Ă«shtĂ« nĂ« modĂ«, por sepse vĂ«rtet do tĂ« ndihmojĂ« nĂ« punĂ«n e pjesĂ«marrĂ«sve tĂ« tjerĂ« nĂ« proces.Â
Kushtimisht: nĂ«se kompanisĂ« i duhet tĂ« lidhĂ« BI dhe ETL â ngarkimin e tĂ« dhĂ«nave dhe pĂ«rditĂ«simin e raportĂ«ve, ja njĂ« themel tipik legacy me tĂ« cilin do tĂ« duhet tĂ« merret Data Engineer (mirĂ« Ă«shtĂ« nĂ«se nĂ« ekip ka gjithashtu dhe njĂ« arkitekt).
Detyrat e Data Engineer
- Zhvillimi, ndërtimi dhe mbështetje e infrastrukturës për punën me të dhënat.
- Përpunimi i gabimeve dhe krijimi i konvejereve të besueshëm për përpunimin e të dhënave.
- Transformimi i të dhënave të pa strukturuara nga burime dinamike të ndryshme në formatin e nevojshëm për analistët.
- Sigurimi i rekomandimeve për përmirësimin e konsistencës dhe cilësisë së të dhënave.
- Sigurimi dhe mbështetje e arkitekturës së të dhënave që përdorin shkencëtarët e të dhënave dhe analistët.
- Përpunimi dhe ruajtja e të dhënave në mënyrë të qëndrueshme dhe efikase në një klaster të shpërndarë me dhjetëra ose qindra serverë.
- Vlerësimi i kompromiseve teknike të mjeteve për krijimin e arkitekturave të thjeshta, por të besueshme, që mund të mbijetojnë dështimet.
- Kontrolli dhe mbështetje e rrjedhave të të dhënave dhe sistemeve të lidhura (konfigurimi i monitorimit dhe alarmeve).
Ekziston njĂ« specializim tjetĂ«r brenda rrugĂ«s sĂ« Data Engineer â ML engineer. NĂ«se e pĂ«rmbledhim, kĂ«ta inxhinierĂ« specializohen nĂ« sjelljen e modeleve tĂ« mĂ«simit tĂ« makinerisĂ« deri nĂ« implementim dhe pĂ«rdorim industrial. Shpesh modeli, i marrĂ« nga shkencĂ«tari i tĂ« dhĂ«nave, Ă«shtĂ« pjesĂ« e njĂ« kĂ«rkimi dhe mund tĂ« mos funksionojĂ« nĂ« kushte tĂ« fushatĂ«s.
Detyrat e Data Scientist
- Ekstraktimi i karakteristikave nga të dhënat për aplikimin e algoritmeve të mësimit të makinerisë.
- Përdorimi i mjeteve të ndryshme të mësimit të makinës për parashikimin dhe klasifikimin e modeleve në të dhëna.
- Rritja e produktivitetit dhe saktësisë së algoritmeve të mësimit të makinës përmes optimizimit dhe konfigurimit të hollësishëm të algoritmeve.
- Formimi i hipotezave "të forta" në përputhje me strategjinë e kompanisë që duhen testuar.
Si Inxhinierët e Të Dhënave, ashtu edhe Shkencëtarët e Të Dhënave kontribuojnë në zhvillimin e një kulture të punës me të dhëna, e cila ndihmon kompaninë të rrisë fitimet ose të ulë shpenzimet.
Me cilat gjuhë dhe mjete punojnë inxhinierët dhe shkencëtarët?
Sot, pritshmĂ«ritĂ« ndaj specialistĂ«ve tĂ« pĂ«rpunimit tĂ« tĂ« dhĂ«nave kanĂ« ndryshuar. Disa vite mĂ« parĂ«, inxhinierĂ«t krijonin kĂ«rkesat e mĂ«dha SQL, shkruanin manualisht MapReduce dhe pĂ«rpunonin tĂ« dhĂ«na me mjete si Informatica ETL, Pentaho ETL, Talend.Â
Në 2020, një specialist nuk mund të kalojë pa njohuri të Python dhe mjeteve moderne të llogaritjes (p.sh. Airflow), si dhe një kuptim të parimeve të punës me platforma cloud (duke i përdorur për të kursyer në "harduer", me respektimin e parimeve të sigurisë).
SAP, Oracle, MySQL, Redis janĂ« mjete tradicionale pĂ«r inxhinierĂ«t e tĂ« dhĂ«nave nĂ« kompanitĂ« e mĂ«dha. JanĂ« tĂ« mira, por kostoja e licencave Ă«shtĂ« kaq e lartĂ« sa arsyeton tĂ« mĂ«sosh tĂ« punosh me to vetĂ«m nĂ« projekte industriale. MegjithatĂ«, ka njĂ« alternativĂ« falas si Postgres â Ă«shtĂ« falas dhe i pĂ«rshtatshĂ«m jo vetĂ«m pĂ«r mĂ«sim.Â

Historikisht, është shpesh kërkuar Java dhe Scala, megjithatë, me zhvillimin e teknologjive dhe qasjeve, këto gjuhë po kalojnë në plan të dytë.
MegjithatĂ«, BigData tĂ« forta: Hadoop, Spark dhe gjithĂ« kafshĂ«t e tjera â nuk janĂ« mĂ« njĂ« kĂ«rkesĂ« e domosdoshme pĂ«r inxhinierĂ«t e tĂ« dhĂ«nave, por njĂ« lloj mjeti pĂ«r zgjidhjen e problemeve qĂ« nuk mund tĂ« zgjidhen me ETL tradicional.Â
Në trend janë shërbimet për përdorimin e mjeteve pa pasur nevojë të dish gjuhën në të cilën janë shkruar (p.sh. Hadoop pa ditur Java), si dhe ofrimi i shërbimeve gati për përpunimin e të dhënave në flux (njohja e zërit ose imazheve në video).
Zgjidhjet industriale nga SAS dhe SPSS janë të njohura, ndërsa Tableau, Rapidminer, Stata dhe Julia gjithashtu përdoren gjerësisht nga shkencëtarët e të dhënave për detyra lokale.

MundĂ«sia pĂ«r tĂ« ndĂ«rtuar vetĂ« pipeline-t iu dha analistĂ«ve dhe data scientist-Ă«ve vetĂ«m disa vjet mĂ« parĂ«: pĂ«r shembull, tani Ă«shtĂ« e mundur tĂ« drejtohen tĂ« dhĂ«nat nĂ« njĂ« ruajtje tĂ« bazuar nĂ« PostgreSQL me skenarĂ« relativisht tĂ« thjeshtĂ«.Â
Zakonisht, përdorimi i konvejereve dhe strukturave të integruara të të dhënave mbetet në duar të inxhinierëve të të dhënave. Por sot, si kurrë më parë, trendi për specialistët T-sh që kanë kompetenca të gjerë në fusha të lidhura është shumë i fortë, pasi mjetet vazhdimisht po thjeshtohen.
Pse Data Engineer dhe Data Scientist duhet të punojnë së bashku
Duke punuar ngushtë me inxhinierët, Data Scientist atëherë mund të përqendrohen në pjesën kërkimore, duke krijuar algorithma të gatshëm për të punuar për mësimin e makinerisë.
Ndërsa inxhinierët përqendrohen në shkallueshmëri, ripërdorimin e të dhënave dhe garantojnë që pipeline-t e hyrjes dhe daljes në çdo projekt specifik përputhen me arkitekturën globale.
Kjo ndarje e detyrave siguron koherencĂ«n e veprimeve mes grupeve tĂ« specialistĂ«ve qĂ« punojnĂ« nĂ« projekte tĂ« ndryshme tĂ« mĂ«simit tĂ« makinerisĂ«.Â
BashkĂ«punimi ndihmon nĂ« krijimin efikas tĂ« produkteve tĂ« reja. ShpejtĂ«sia dhe cilĂ«sia arrihen falĂ« balancĂ«s midis krijimit tĂ« njĂ« shĂ«rbimi pĂ«r tĂ« gjithĂ« (ruajtja globale ose integrimi i tabelave tĂ« kontrollit) dhe realizimit tĂ« çdo nevoje ose projekti tĂ« veçantĂ« (pipeline i ngushtuar, lidhja e burimeve tĂ« jashtme).Â
Puna e ngushtë me data scientist-et dhe analistët ndihmon inxhinierët të zhvillojnë aftësi analitike dhe kërkimore për të shkruar kod më cilësor. Kështu përmirësohet shkëmbimi i njohurive midis përdoruesve të ruajtjeve dhe liqeneve të të dhënave, duke bërë projektet më fleksibël dhe duke siguruar rezultate më të qëndrueshme afatgjata.
NĂ« kompanitĂ« qĂ« kanĂ« si qĂ«llim zhvillimin e kulturĂ«s sĂ« punĂ«s me tĂ« dhĂ«na dhe ndĂ«rtimin e proceseve tĂ« biznesit mbi atĂ« bazĂ«, Data Scientist dhe Data Engineer plotĂ«sojnĂ« njĂ«ri-tjetrin dhe krijojnĂ« njĂ« sistem tĂ« plotĂ« tĂ« analizĂ«s sĂ« tĂ« dhĂ«nave.Â
Në materialin e ardhshëm do të flasim për arsimimin që duhet të kenë Data Engineer dhe Data Scientist, cilat aftësi duhet të zhvillojnë dhe si është tregu.
Nga redaksia e Netologjisë
Nëse po shqyrtoni profesionin e Data Engineer-it ose Data Scientist-it, ju ftojmë të eksploroni programet e kurseve tona:
- Profesion i «». Â
- Profesion i «».
Burimi: habr.com
