Sipas , data engineer aktualisht është profesioni, kërkesa për të cilin po rritet më shpejt se për çdo profesion tjetër. Data engineer luan një rol kritikisht të rëndësishëm në organizatë: krijon dhe mban funksionale pipeline-et dhe bazat e të dhënave që përdoren për përpunimin, transformimin dhe ruajtjen e të dhënave. Cilat aftësi u duhen më shumë përfaqësuesve të këtij profesioni? A ndryshon kjo listë nga ajo që kërkohet nga data scientists? Për të gjitha këto do të mësoni në artikullin tim.
Kam analizuar shpalljet e punës për pozicionin data engineer në formën në të cilën paraqiteshin në janar 2020, për të kuptuar se cilat aftësi teknologjike janë më të kërkuarat. Më pas i krahasova rezultatet me statistikat e shpalljeve për pozicionin data scientist, dhe dolën në pah disa dallime interesante.
Pa hyrë në një hyrje të gjatë, ja dhjetë teknologjitë që përmenden më shpesh në shpalljet e punës:

Përmendjet e teknologjive në shpalljet për pozicionin e data engineer në vitin 2020
Le të merremi me këtë.
Përgjegjësitë e data engineer
Sot, puna që bëjnë data engineers ka një rëndësi të jashtëzakonshme për organizatat: janë pikërisht këta specialistë që përgjigjen për ruajtjen e informacionit dhe e përgatisin atë në një formë të tillë që punonjësit e tjerë të mund të punojnë me të. Data engineers ndërtojnë pipeline-e për të organizuar marrjen e të dhënave, si në rrjedhë ashtu edhe në paketa, nga një sërë burimesh. Më pas, këto pipeline-e kryejnë operacione nxjerrjeje, transformimi dhe ngarkimi (me fjalë të tjera, procese ETL), duke i bërë të dhënat më të përshtatshme për përdorim të mëtejshëm. Pas kësaj, të dhënat u kalohen analistëve dhe data scientists për përpunim më të thelluar. Në fund, të dhënat e përfundojnë udhëtimin e tyre në panele informative, raporte dhe modele të machine learning.
Kërkova informacion që do të më lejonte të nxirrja një përfundim se cilat teknologji janë aktualisht më të kërkuarat në punën e një data engineer.
Metodat
Mblodha informacion nga tre faqe interneti pĂ«r kĂ«rkim pune â , dhe dhe analizova se cilat fjalĂ« kyçe shfaqen sĂ« bashku me âdata engineerâ nĂ« tekstet e shpalljeve tĂ« punĂ«s tĂ« destinuara pĂ«r banorĂ«t e SHBA-sĂ«. PĂ«r kĂ«tĂ« detyrĂ« pĂ«rdora dy biblioteka Python â dhe NĂ« grupin e fjalĂ«ve kyçe pĂ«rfshiva si ato qĂ« ishin nĂ« listĂ«n e mĂ«parshme pĂ«r analizĂ«n e vendeve tĂ« punĂ«s pĂ«r pozicionin data scientist, ashtu edhe ato qĂ« i pĂ«rzgjodha manualisht duke lexuar shpalljet e punĂ«s pĂ«r data engineers. LinkedIn nuk u pĂ«rfshi te burimet, sepse aty mĂ« bllokuan pas pĂ«rpjekjes sime tĂ« mĂ«parshme pĂ«r tĂ« mbledhur tĂ« dhĂ«na.
Për secilën fjalë kyçe llogarita përqindjen e paraqitjeve ndaj numrit total të teksteve veçmas për secilin sajt, dhe më pas nxora vlerën mesatare për të tre burimet.
Rezultatet
Më poshtë janë paraqitur tridhjetë terma teknikë nga fusha e data engineering me rezultatet më të larta në të tre sajtet e punësimit.

Dhe ja të njëjtat shifra, por të paraqitura në formë tabele:

Le tâi marrim me radhĂ«.
Përmbledhje e rezultateve
Si SQL, ashtu edhe Python pĂ«rmenden nĂ« mĂ« shumĂ« se dy tĂ« tretat e vendeve tĂ« punĂ«s tĂ« analizuara. PikĂ«risht kĂ«to dy teknologji ka kuptim tĂ« mĂ«sohen sĂ« pari. â Ă«shtĂ« njĂ« gjuhĂ« programimi shumĂ« popullore, qĂ« pĂ«rdoret pĂ«r punĂ« me tĂ« dhĂ«nat, krijimin e faqeve web dhe shkrimin e skripteve. shkurtohet nga Structured Query Language (gjuha e pyetjeve tĂ« strukturuara); ai nĂ«nkupton njĂ« standard tĂ« zbatuar nga njĂ« grup gjuhĂ«sh dhe pĂ«rdoret pĂ«r nxjerrjen e tĂ« dhĂ«nave nga bazat relacionale. ĂshtĂ« shfaqur prej kohĂ«sh dhe ka dĂ«shmuar qĂ«ndrueshmĂ«ri tĂ« lartĂ«.
PĂ«r Spark flitet nĂ« rreth gjysmĂ«n e vendeve tĂ« punĂ«s. â Ă«shtĂ« njĂ« «motor analitik i unifikuar pĂ«r pĂ«rpunimin e tĂ« dhĂ«nave tĂ« mĂ«dha me module tĂ« integruara pĂ«r transmetim rrjedhĂ«s, SQL, machine learning dhe pĂ«rpunim grafikĂ«sh». Ai Ă«shtĂ« veçanĂ«risht i popullarizuar te ata qĂ« punojnĂ« me baza tĂ« dhĂ«nash me pĂ«rmasa tĂ« mĂ«dha.
AWS shfaqet në rreth 45% të teksteve të vendeve të punës. Kjo është një platformë cloud computing e Amazon; ajo mban pjesën më të madhe të tregut mes të gjitha platformave cloud.
Pas tyre vijnĂ« Java dhe Hadoop â pak mĂ« shumĂ« se 40% secili. â njĂ« gjuhĂ« shumĂ« e pĂ«rhapur dhe e sprovuar nĂ« praktikĂ«, e cila nĂ« u rendit nĂ« vendin e dhjetĂ« mes gjuhĂ«ve qĂ« u shkaktojnĂ« programuesve mĂ« shumĂ« tmerr. NĂ« tĂ« kundĂ«rt, Python doli i dyti mes gjuhĂ«ve mĂ« tĂ« dashura. Java menaxhohet nga Oracle, dhe gjithçka qĂ« duhet tĂ« dini pĂ«r tĂ« mund tĂ« kuptohet nga kjo pamje e faqes zyrtare nga janari i vitit 2020.

Sikur bëra një xhiro me makinë kohe
përdor modelin softuerik MapReduce me klasterë serverësh për big data. Tani kjo qasje po braktiset gjithnjë e më shpesh.
MĂ« tej shohim Hive, Scala, Kafka dhe NoSQL â secila prej kĂ«tyre teknologjive pĂ«rmendet nĂ« njĂ« tĂ« katĂ«rtĂ«n e vendeve tĂ« lira tĂ« paraqitura. Apache Hive Ă«shtĂ« njĂ« sistem ruajtjeje tĂ« dhĂ«nash qĂ« âe thjeshton leximin, shkrimin dhe menaxhimin e grupeve tĂ« mĂ«dha tĂ« tĂ« dhĂ«nave tĂ« vendosura nĂ« depo tĂ« shpĂ«rndara, me ndihmĂ«n e SQLâ. â gjuhĂ« programimi qĂ« pĂ«rdoret gjerĂ«sisht nĂ« punĂ«n me big data. NĂ« veçanti, Spark Ă«shtĂ« krijuar nĂ« Scala. NĂ« renditjen e pĂ«rmendur mĂ« herĂ«t tĂ« gjuhĂ«ve qĂ« ngjallin frikĂ«, Scala renditet nĂ« vendin e njĂ«mbĂ«dhjetĂ«. â platformĂ« e shpĂ«rndarĂ« pĂ«r pĂ«rpunimin e mesazheve nĂ« rrjedhĂ«. ĂshtĂ« shumĂ« e njohur si mjet pĂ«r transmetimin e tĂ« dhĂ«nave nĂ« rrjedhĂ«.
pozicionohen si alternativë ndaj SQL. Ato dallohen sepse nuk janë relacionale, nuk janë të strukturuara dhe ofrojnë shkallëzim horizontal. NoSQL ka fituar njëfarë popullariteti, megjithatë entuziazmi i tepruar për këtë qasje, deri edhe te parashikimet se do ta zëvendësonte SQL si paradigmën dominuese të ruajtjes, duket se tashmë i përket së kaluarës.
Krahasimi me termat në vendet e lira për data scientist
Këta janë tridhjetë termat teknologjikë më të përhapur te punëdhënësit në fushën e data science. Këtë listë e përftova në të njëjtën mënyrë që përshkrova më sipër për data engineering.

Përmendjet e teknologjive në vendet e lira për pozicionin data scientist në vitin 2020
Nëse flasim për numrin total, krahasuar me grupin e shqyrtuar më herët, vende të lira kishte 28% më shumë (12 013 kundrejt 9396). Le të shohim cilat teknologji shfaqen më rrallë në vendet e lira për data scientist sesa për data engineer.
Më të njohura në data engineering
Grafiku më poshtë tregon fjalët kyçe me diferencë mesatare në vlera më të madhe se 10% ose më të vogël se -10%.

Dallimet më të mëdha në shpeshtësinë e fjalëve kyçe te data engineer dhe data scientist
Rritjen më të madhe e tregon AWS: në data engineering ai shfaqet 25% më shpesh sesa në data science (përafërsisht 45% dhe 20% e numrit total të vendeve të lira, përkatësisht). Një diferencë e ndjeshme!
Ja tĂ« njĂ«jtat tĂ« dhĂ«na nĂ« njĂ« paraqitje paksa ndryshe â nĂ« grafik, rezultatet pĂ«r tĂ« njĂ«jtĂ«n fjalĂ« kyçe nĂ« vendet e lira pĂ«r pozicionet data engineer dhe data scientist janĂ« vendosur krah pĂ«r krah.

Dallimet më të mëdha në shpeshtësinë e fjalëve kyçe te data engineer dhe data scientist
Rritjen tjetĂ«r mĂ« tĂ« madhe e vura re te Spark â njĂ« data engineer shpesh duhet tĂ« punojĂ« me tĂ« dhĂ«na nĂ« shkallĂ« tĂ« madhe. gjithashtu u rrit me 20%, pra pothuajse katĂ«r herĂ« mĂ« shumĂ« krahasuar me rezultatin nĂ« ofertat e punĂ«s pĂ«r data scientist. Transferimi i tĂ« dhĂ«nave Ă«shtĂ« njĂ« nga pĂ«rgjegjĂ«sitĂ« kryesore tĂ« njĂ« data engineer. SĂ« fundi, numri i pĂ«rmendjeve doli 15% mĂ« i lartĂ« nĂ« data engineering pĂ«r Java, NoSQL, Redshift, SQL dhe Hadoop.
Më pak të njohura në data engineering
Tani le të shohim cilat teknologji janë më pak të njohura në ofertat e punës për data engineer.
Rënia më e fortë krahasuar me fushën e data science u vu re te : atje ai përmendej në rreth 56% të ofertave të punës, ndërsa këtu vetëm në 17%. Mbresëlënëse. R është një gjuhë programimi e preferuar nga studiuesit dhe statistikienët, si dhe mban vendin e tetë në renditjen e gjuhëve më të frikshme.
gjithashtu shfaqet dukshĂ«m mĂ« rrallĂ« nĂ« ofertat e punĂ«s pĂ«r pozicionin data engineer â diferenca Ă«shtĂ« 14%. SAS Ă«shtĂ« njĂ« gjuhĂ« pronĂ«sore e krijuar pĂ«r punĂ« me statistikĂ« dhe tĂ« dhĂ«na. NjĂ« detaj interesant: duke gjykuar nga rezultatet e , kohĂ«t e fundit ai ka humbur shumĂ« terren â mĂ« shumĂ« se çdo teknologji tjetĂ«r.
Të kërkuara si në data engineering, ashtu edhe në data science
Duhet theksuar se tetë nga dhjetë pozicionet e para në të dy grupet përputhen. SQL, Python, Spark, AWS, Java, Hadoop, Hive dhe Scala hynë në dhjetëshen kryesore si për industrinë e data engineering, ashtu edhe për data science. Në grafikun më poshtë mund të shihni pesëmbëdhjetë teknologjitë më të kërkuara nga punëdhënësit për data engineers, dhe pranë tyre treguesin për ofertat e punës për data scienctists.

Rekomandime
NĂ«se doni tĂ« merreni me data engineering, do tâju kĂ«shilloja tĂ« zotĂ«roni teknologjitĂ« e mĂ«poshtme â po i rendis sipas prioritetit tĂ« pĂ«rafĂ«rt.
MĂ«soni SQL. UnĂ« do tâju rekomandoja pikĂ«risht PostgreSQL, sepse Ă«shtĂ« open-source, ka popullaritet tĂ« madh nĂ« komunitet dhe Ă«shtĂ« nĂ« fazĂ« rritjeje. Si tĂ« pĂ«rdorni gjuhĂ«n mund ta mĂ«soni nga libri My Memorable SQL â versioni i tij pilot Ă«shtĂ« i disponueshĂ«m .
Përvetësoni Python, edhe nëse jo në nivelin më të avancuar. Libri My Memorable Python është menduar pikërisht për fillestarët. Mund ta blini në , në kopje elektronike ose fizike, sipas zgjedhjes suaj, ose ta shkarkoni në format pdf ose epub .
Sapo tĂ« njiheni me Python, kaloni te pandas â njĂ« bibliotekĂ« e Python qĂ« pĂ«rdoret pĂ«r pastrimin dhe pĂ«rpunimin e tĂ« dhĂ«nave. NĂ«se synoni tĂ« punoni nĂ« njĂ« kompani ku kĂ«rkohet aftĂ«sia pĂ«r tĂ« shkruar nĂ« Python (dhe shumica janĂ« tĂ« tilla), mund tĂ« jeni tĂ« sigurt se njohja e pandas do tĂ« merret si e mirĂ«qenĂ«. Tani po pĂ«rfundoj njĂ« udhĂ«zues hyrĂ«s pĂ«r punĂ«n me pandas â mund tĂ« , qĂ« tĂ« mos humbisni publikimin.
Mësoni AWS. Nëse doni të bëheni data engineer, nuk bëhet pa një platformë cloud në arsenalin tuaj, dhe AWS është më e popullarizuara prej tyre. Mua më ndihmuan shumë kurset e , kur po studioja , mendoj se kanë materiale të mira edhe për AWS.
Nëse e keni përvetësuar tashmë gjithë këtë listë dhe dëshironi të rriteni edhe më shumë në sytë e punëdhënësve si data engineer, ju sugjeroj të shtoni Apache Spark për punën me big data. Edhe pse studimi im për vendet e lira në data science tregoi një rënie të interesit, për data engineer ai ende shfaqet pothuajse në çdo vend të dytë pune.
NĂ« fund
Shpresoj qĂ« ky pĂ«rmbledhje e teknologjive mĂ« tĂ« kĂ«rkuara pĂ«r data engineer tâju ketĂ« qenĂ« i dobishĂ«m. NĂ«se ju intereson si paraqitet situata nĂ« vendet e lira tĂ« punĂ«s pĂ«r analistĂ«t, lexoni . Ju uroj suksese nĂ« inxhinieri!
Burimi: habr.com
