Sipas , inxhinieri i të dhënave aktualisht është profesioni me kërkesë më të lartë. Inxhinieri i të dhënave luan një rol kritik në organizata - krijon dhe mirëmban linjat dhe bazat e të dhënave që përdoren për procesimin, transformimin dhe ruajtjen e të dhënave. Cilat janë aftësitë më të rëndësishme që kërkohen prej kësaj profesioni? A ndryshon lista nga ajo që kërkohet nga data scientist? Do të mësoni për të gjitha këto nga artikulli im.
Kam analizuar ofertat e punës për pozitat e inxhinierëve të të dhënave ashtu siç janë në janar të vitit 2020, për të kuptuar se cilat aftësi në fushën e teknologjisë janë më të njohura. Pastaj kam krahasuar rezultatet me statistikat për ofertat e punës për pozitat e data scientist - kështu u zbulua disa dallime interesante.
Pa u zgjatur shumë, ja dhjetë teknologji që përmenden më shpesh në tekstet e ofertave të punës:

Përmendjet e teknologjive në ofertat për pozitat e inxhinierëve të të dhënave në vitin 2020
Le të hedhim një vështrim.
Detyrat e inxhinierit të të dhënave
Aktualisht, puna qĂ« kryejnĂ« inxhinierĂ«t e tĂ« dhĂ«nave ka njĂ« rĂ«ndĂ«si tĂ« madhe pĂ«r organizatat â kĂ«ta njerĂ«z janĂ« pĂ«rgjegjĂ«s pĂ«r ruajtjen e informacionit dhe pĂ«r ta sjellĂ« atĂ« nĂ« njĂ« formĂ« qĂ« stafi i tjerĂ« mund ta pĂ«rdorĂ«. InxhinierĂ«t e tĂ« dhĂ«nave ndĂ«rtrojnĂ« pipelines pĂ«r tĂ« siguruar marrjen e tĂ« dhĂ«nave, nĂ« mĂ«nyrĂ« tĂ« vazhdueshme ose nĂ« paketa, nga burime tĂ« shumta. MĂ« pas, kĂ«to pipeline kryejnĂ« operacione tĂ« ekstraktimit, transformimit dhe ngarkimit (ndryshe ETL), duke e bĂ«rĂ« informacionin mĂ« tĂ« pĂ«rshtatshĂ«m pĂ«r pĂ«rdorim tĂ« mĂ«tejshĂ«m. Pas kĂ«saj, tĂ« dhĂ«nat u dorĂ«zohen analistĂ«ve dhe shkencĂ«tarĂ«ve tĂ« tĂ« dhĂ«nave pĂ«r njĂ« pĂ«rpunim mĂ« tĂ« thellĂ«. NĂ« fund, tĂ« dhĂ«nat mbyllin udhĂ«timin e tyre nĂ« panellet informative, nĂ« raporte dhe nĂ« modele pĂ«r machine learning.
Kisha kërkuar informacion që do të lejonte të arrija në përfundimin se cilat teknologji janë më kërkuar në punën e inxhinierëve të të dhënave aktualisht.
Metodat
Kisha mbledhur informacion nga tri webfaqe pĂ«r kĂ«rkimin e punĂ«s â , dhe dhe kisha parĂ« se cilat fjalĂ« kyçe shfaqen nĂ« lidhje me 'data engineer' nĂ« tekstet e ofertave tĂ« punĂ«s, tĂ« dedikuara pĂ«r banorĂ«t e Shteteve tĂ« Bashkuara. PĂ«r kĂ«tĂ« detyrĂ«, unĂ« kam pĂ«rdorur dy biblioteka Python â dhe . NĂ« grupin e fjalĂ«ve kyçe kam pĂ«rfshirĂ« ata qĂ« ishin nĂ« listĂ«n e mĂ«parshme pĂ«r analizĂ«n e vendeve tĂ« punĂ«s pĂ«r pozitat e shkencĂ«tarit tĂ« tĂ« dhĂ«nave, si dhe ata qĂ« kam pĂ«rzgjedhur manualisht duke lexuar shpalljet pĂ«r inxhinierĂ«t e tĂ« dhĂ«nave. LinkedIn nuk ishte njĂ« nga burimet, pasi mĂ« ndaluan aty pas pĂ«rpjekjes sĂ« kaluar pĂ«r tĂ« mbledhur tĂ« dhĂ«na.
Për çdo fjalë kyçe, kam numëruar përqindjen e shfaqjeve nga numri total i teksteve në secilin nga faqet e internetit veçmas, dhe pastaj kam llogaritur mesataren nga tre burimet.
Rezultatet
Më poshtë janë tridhjetë terma teknikë në fushën e inxhinierisë së të dhënave me treguesit më të lartë në të tri faqet e vendeve të punës.

Ja, këto janë të njëjtat shifra, por të paraqitura në formën e një tabele:

Le të shkojmë për radhë.
Përmbledhje e rezultateve
Si SQL ashtu edhe Python shfaqen nĂ« mĂ« shumĂ« se dy tĂ« tretat e vendeve tĂ« punĂ«s tĂ« shqyrtuara. PikĂ«risht kĂ«to dy teknologji ka kuptim tĂ« studiohen fillimisht. â njĂ« gjuhĂ« programuese shumĂ« e njohur, e pĂ«rdorur pĂ«r punĂ«n me tĂ« dhĂ«na, krijimin e uebfaqeve dhe shkruan skenarĂ«. qĂ« do tĂ« thotĂ« GjuhĂ« e KĂ«rkimeve tĂ« Strukturuara (SQL); ajo pĂ«rfaqĂ«son njĂ« standard tĂ« zbatuar nga njĂ« grup gjuhĂ«sh dhe pĂ«rdoret pĂ«r tĂ« nxjerrĂ« tĂ« dhĂ«na nga bazat e tĂ« dhĂ«nave relacionale. Ajo ka lindur njĂ« kohĂ« tĂ« gjatĂ« dhe ka treguar qĂ« Ă«shtĂ« shumĂ« e qĂ«ndrueshme.
Përdoret për Spark në rreth gjysmën e ofertave të punës. është një "motor analitik i integruar për përpunimin e të dhënave të mëdha me module të përfshira për transmetim, SQL, mësim makinerie dhe përpunim grafik". Ai është veçanërisht popullor për ata që punojnë me baza të dhënash të mëdha.
AWS përmendet në rreth 45% të teksteve të ofertave të punës. Ky është një platformë e përpunimit në re e prodhimit të Amazon; ajo zotëron pjesën më të madhe të tregut midis të gjitha platformave të tjera në re.
MĂ« pas ndjekin Java dhe Hadoop â pak mĂ« shumĂ« se 40% pĂ«r secilin. Ă«shtĂ« njĂ« gjuhĂ« e gjerĂ« e pĂ«rdorur, e provuar nĂ« betejĂ«, qĂ« nĂ« zuri i dhjetĂ« nĂ« mesin e gjuhĂ«ve qĂ« shkaktojnĂ« tmerr te programuesit. NĂ« kontrast me tĂ«, Python doli i dyti si gjuhĂ« mĂ« e dashur. Gjuha Java kontrollohet nga Oracle, dhe gjithçka qĂ« duhet tĂ« dini pĂ«r tĂ« mund tĂ« kuptohet nga ky screenshot i faqes zyrtare nga janari 2020.

Si të kisha bërë një udhëtim me makinë në kohë
përdor modelin e softuerit MapReduce me klasterë serverësh për të dhëna të mëdha. Tani kjo model po braktiset gjithnjë e më shpesh.
Pastaj shohim Hive, Scala, Kafka dhe NoSQL â secila nga kĂ«to teknologji pĂ«rmendet nĂ« njĂ« tĂ« katĂ«rtĂ«n e aktiviteteve tĂ« punĂ«s tĂ« paraqitura. Apache Hive Ă«shtĂ« njĂ« program-arkiv qĂ« "thjeshton leximin, shkrimin dhe menaxhimin e grupeve tĂ« mĂ«dha tĂ« tĂ« dhĂ«nave qĂ« ndodhen nĂ« depo tĂ« shpĂ«rndara, duke pĂ«rdorur SQL". â njĂ« gjuhĂ« programimi qĂ« pĂ«rdoret aktivisht nĂ« punĂ«n me tĂ« dhĂ«na tĂ« mĂ«dha. NĂ« veçanti, Spark u zhvillua nĂ« Scala. NĂ« renditjen e pĂ«rmendur mĂ« parĂ«, Scala zĂ« vendin e njĂ«mbĂ«dhjetĂ«. â njĂ« platformĂ« e shpĂ«rndarĂ« pĂ«r pĂ«rpunimin e mesazheve nĂ« rrjedhĂ«. ShumĂ« popullore si njĂ« mjet pĂ«r transmetimin e tĂ« dhĂ«nave.
përballen me SQL. Ato dallohet për faktin se nuk janë relacional, nuk janë të strukturuar dhe kanë skalabilitet horizontal. NoSQL ka fituar disa popullaritet, megjithatë, entuziazmi i tepruar për këtë qasje, deri në profeci se do të zëvendësojë SQL si paradigma dominuese e ruajtjes, duket se ka mbetur pas.
Krahasimi me terminologjinë në shpalljet e punës për data scientist
Ja tridhjetë terma teknologjikë më të zakonshëm nga punëdhënësit në fushën e data science. Ky listë u mor në të njëjtën mënyrë që e përshkrova më lart për inxhinierinë e të dhënave.

Përmendjet e teknologjive në shpalljet për pozita data scientist në vitin 2020
Në terma të përgjithshëm, në krahasim me grupin e shqyrtuar më parë, ka më shumë shpallje punësh me 28% (12,013 për më shumë 9,396). Le të shohim se cilat teknologji shfaqen më rrallë në shpalljet për data scientists sesa për data engineers.
Më të popullarizuara në inxhinierinë e të dhënave
Në grafikun më poshtë janë fjalë kyçe me një ndryshim mesatar në vlera më shumë se 10% ose më pak se -10%.

Dallimet më të mëdha në frekuencën e fjalëve kyçe mes data engineer dhe data scientist
Rritja më e dukshme është te AWS: në inxhinierinë e të dhënave ajo shfaqet 25% më shpesh se në shkencën e të dhënave (përkatësisht rreth 45% dhe 20% e totalit të vendeve të punës). Diferenca është e ndjeshme!
KĂ«to janĂ« tĂ« njĂ«jtat tĂ« dhĂ«na nĂ« njĂ« prezantim pak ndryshe â nĂ« grafik, rezultatet pĂ«r njĂ« fjalĂ« kyçe tĂ« njĂ«jtĂ« nĂ« vendet e punĂ«s pĂ«r inxhinier tĂ« tĂ« dhĂ«nave dhe shkencĂ«tar tĂ« tĂ« dhĂ«nave janĂ« renditur ngjitur.

Dallimet më të mëdha në frekuencën e fjalëve kyçe mes data engineer dhe data scientist
Rritja e dytĂ« mĂ« e madhe Ă«shtĂ« te Spark â inxhinieri i tĂ« dhĂ«nave shpesh duhet tĂ« punojĂ« me tĂ« dhĂ«na tĂ« mĂ«dha. po ashtu ka shĂ«nuar rritje prej 20%, pra pothuajse katĂ«r herĂ« mĂ« shumĂ« se sa rezultati pĂ«r vendet e punĂ«s shkencĂ«tar tĂ« tĂ« dhĂ«nave. Transferimi i tĂ« dhĂ«nave Ă«shtĂ« njĂ« nga pĂ«rgjegjĂ«sitĂ« kryesore tĂ« inxhinierit tĂ« tĂ« dhĂ«nave. NĂ« fund, numri i pĂ«rmendjeve rezultoi tĂ« ishte 15% mĂ« shumĂ« nĂ« fushĂ«n e inxhinierisĂ« sĂ« tĂ« dhĂ«nave pĂ«r Java, NoSQL, Redshift, SQL dhe Hadoop.
Më pak të njohura në inxhinierinë e të dhënave
Tani le të shohim se cilat teknologji janë më pak të njohura në vendet e punës për inxhinier të të dhënave.
RĂ«nia mĂ« e theksuar nĂ« krahasim me fushĂ«n e shkencĂ«s sĂ« tĂ« dhĂ«nave ndodhi te : atje ajo figuroi nĂ« rreth 56% tĂ« vendeve tĂ« punĂ«s, kĂ«tu â vetĂ«m nĂ« 17%. I habitshĂ«m. R Ă«shtĂ« njĂ« gjuhĂ« programimi qĂ« Ă«shtĂ« e njohur midis shkencĂ«tarĂ«ve dhe statistikaneve, si dhe zĂ« vendin e tetĂ« nĂ« renditjen e gjuhĂ«ve tĂ« tmerrshme.
ndodhet gjithashtu nĂ« ofertat e punĂ«s pĂ«r pozitat e inxhinierĂ«ve tĂ« tĂ« dhĂ«nave nĂ« mĂ«nyrĂ« tĂ« dukshme mĂ« rrallĂ« â diferenca Ă«shtĂ« 14%. SAS Ă«shtĂ« njĂ« gjuhĂ« e patentuar, e cila Ă«shtĂ« krijuar pĂ«r punĂ« me statistika dhe tĂ« dhĂ«na. NjĂ« pikĂ« interesant: nĂ« pĂ«rputhje me rezultatet , sĂ« fundmi ajo ka humbur shumĂ« pozita â mĂ« shumĂ« se çdo teknologji tjetĂ«r.
Të kërkuara dhe në inxhinierinë e të dhënave, ashtu si në shkencën e të dhënave
Duhet tĂ« theksohet se tetĂ« nga dhjetĂ« pozita kryesore nĂ« tĂ« dyja grupet pĂ«rputhen. SQL, Python, Spark, AWS, Java, Hadoop, Hive dhe Scala janĂ« nĂ« dhjetĂ«she si pĂ«r sektorin e inxhinierisĂ« sĂ« tĂ« dhĂ«nave ashtu edhe pĂ«r shkencĂ«n e tĂ« dhĂ«nave. NĂ« grafikĂ«n mĂ« poshtĂ« mund tĂ« shihni pesĂ« mbĂ«shtetje mĂ« tĂ« njohura tĂ« teknologjisĂ« nga punĂ«dhĂ«nĂ«sit e inxhinierĂ«ve tĂ« tĂ« dhĂ«nave, ndĂ«rsa pranĂ« â treguesin e tyre pĂ«r ofertat e punĂ«s pĂ«r shkencĂ«tarĂ«t e tĂ« dhĂ«nave.

R rekomandimet
NĂ«se dĂ«shironi tĂ« merremi me inxhinierinĂ« e tĂ« dhĂ«nave, do t'ju sugjeroja tĂ« njihni kĂ«to teknologji â po i rendisĂ« ato sipas rendit tĂ« pĂ«rafĂ«rt tĂ« rĂ«ndĂ«sisĂ«.
MĂ«soni SQL. Ju inkurajoj konkretisht pĂ«r PostgreSQL, sepse ka kod tĂ« hapur, popullaritet tĂ« madh nĂ« komunitet dhe ndodhet nĂ« njĂ« fazĂ« rritjeje. Si tĂ« pĂ«rdorni gjuhĂ«n, mund tĂ« mĂ«soni nga libri My Memorable SQL â versioni pilot i saj Ă«shtĂ« i disponueshĂ«m. .
Mësoni Python-in, jo domosdoshmërisht në një nivel të avancuar. Libri My Memorable Python është pikërisht për fillestarët. Mund ta blini në , një kopje elektronike ose fizike, sipas zgjedhjes suaj, ose ta shkarkoni në formatin pdf ose epub .
Pasi tĂ« njiheni me Python-in, kaloni te pandas â biblioteka Python qĂ« pĂ«rdoret pĂ«r pastrimin dhe pĂ«rpunimin e tĂ« dhĂ«nave. NĂ«se synoni tĂ« punoni nĂ« njĂ« kompani ku kĂ«rkohet njohuri pĂ«r Python (dhe shumica e tyre e kĂ«rkon kĂ«tĂ«), mund tĂ« jeni tĂ« sigurt se njohuria pĂ«r pandas do tĂ« supozohet si standart. UnĂ« po pĂ«rfundoj njĂ« udhĂ«zues hyrĂ«s pĂ«r punĂ«n me pandas â mund tĂ« , pĂ«r tĂ« mos humbur momentin e daljes.
Mësoni AWS. Nëse dëshironi të bëheni inxhinier të të dhënave, pa një platformë cloud në dorë nuk e kaloni dot, dhe AWS është më e njohura prej tyre. Kur unë studoja , ndihmuan shumë kur studioja , mendoj se do të kenë materiale të mira edhe për AWS.
Nëse keni kaluar të gjithë këtë listë dhe dëshironi të rriteni në sytë e punëdhënësve si inxhinier të dhënash, sugjeroj të shtoni Apache Spark për punën me të dhëna të mëdha. Edhe pse kërkimi im për njoftime pune në fushën e të dhënave ka treguar një rënie të interesit, për inxhinierët e dhënave ai ende shfaqet në pothuajse çdo të dytë njoftim.
NĂ« fund
Shpresoj që ky përmbledhje i teknologjive më të kërkuara për inxhinierët e dhënave t'ju ketë dukur i dobishëm. Nëse jeni të interesuar se si kurrizhen punët për analistët, lexoni . Supe-r suksese në inxhinierinë tuaj!
Burimi: habr.com
