Si qĂ« tĂ« transferoni, eksportoni dhe integroni tĂ« dhĂ«na shumĂ« tĂ« mĂ«dha nĂ« mĂ«nyrĂ« tĂ« lirĂ« dhe tĂ« shpejtĂ«? ÇfarĂ« Ă«shtĂ« optimizimi pushdown?

Çdo operacion me tĂ« dhĂ«na tĂ« mĂ«dha kĂ«rkon kapacitete tĂ« mĂ«dha kompjuterike. Transferimi i zakonshĂ«m i tĂ« dhĂ«nave nga baza nĂ« Hadoop mund tĂ« zgjasĂ« javĂ« ose tĂ« kushtojĂ« si njĂ« krah avioni. A nuk doni tĂ« prisni dhe tĂ« shpenzoni? Balanconi ngarkesĂ«n mbi platforma tĂ« ndryshme. NjĂ« nga mĂ«nyrat – Ă«shtĂ« optimizimi pushdown.

I kërkova trajnerit kryesor në Rusi për zhvillimin dhe administrimin e produkteve Informatica, Aleksej Ananjev, që të flasë për funksionin e optimizimit pushdown në Informatica Big Data Management (BDM). A ka ndodhur ndonjëherë të mësoni të punoni me produktet e Informatica? Me siguri Aleksej ju ka mësuar bazat e PowerCenter dhe ka shpjeguar se si të krijoni mappings.

Aleksej Ananjev, drejtues i departamentit të trajnimit DIS Group

ÇfarĂ« Ă«shtĂ« pushdown?

Shumica prej jush janĂ« tĂ« njohur me Informatica Big Data Management (BDM). Produkti mundĂ«son integrimin e tĂ« dhĂ«nave tĂ« mĂ«dha nga burime tĂ« ndryshme, t’i transferoni ato midis sistemeve tĂ« ndryshme, ofron akses tĂ« lehtĂ« nĂ« to, lejon profilizimin e tyre dhe shumĂ« mĂ« tepĂ«r.
Në duar të zotë, BDM është në gjendje të realizojë mrekulli: detyrat do të kryhen shpejt dhe me burime minimale kompjuterike.

A dëshironi edhe ju kështu? Mësoni sesi të përdorni funksionin pushdown në BDM për të shpërndarë ngarkesën kompjuterike midis platformave të ndryshme. Teknologjia pushdown lejon kthimin e mapping-ut në një skript dhe zgjedhjen e mjedisit ku do të ekzekutohet ky skript. Kjo mundësi e zgjedhjes bën të mundur kombinimin e pikave të forta të platformave të ndryshme dhe arritjen e performancës maksimale të tyre.

Për të konfigurimin e mjedisit të ekzekutimit të skriptit, duhet të zgjidhni llojin e pushdown. Skripti mund të ekzekutohet plotësisht në Hadoop ose të shpërndahet pjesërisht midis burimit dhe marrësit. Ekzistojnë 4 lloje të mundshme pushdown. Mapping-u mund të mos kthehet në skript (native). Mapping-u mund të ekzekutohet maksimalisht në burim (source) ose plotësisht në burim (full). Po ashtu, mapping-u mund të kthehet në skript Hadoop (none).

Optimizimi pushdown

TĂ« katĂ«r llojet e pĂ«rmendura mund tĂ« kombinohen nĂ« mĂ«nyra tĂ« ndryshme – optimizimi i pushdown pĂ«r nevojat specifike tĂ« sistemit. PĂ«r shembull, shpesh Ă«shtĂ« mĂ« e arsyeshme tĂ« nxirreni tĂ« dhĂ«nat nga baza e tĂ« dhĂ«nave duke pĂ«rdorur mundĂ«sitĂ« e saj tĂ« veta. NdĂ«rsa transformimi i tĂ« dhĂ«nave – nga fuqitĂ« e Hadoop-it, pĂ«r tĂ« mos e ngarkuar vetĂ« bazĂ«n.

Le të shqyrtojmë një rast kur si burimi ashtu edhe marrësi ndodhen në DB, dhe platforma e ekzekutimit të transformimeve mund të zgjidhet: në varësi të cilësimeve, kjo do të jetë Informatica, serveri i DB ose Hadoop. Ky shembull do të lejojë të kuptojmë më saktë anën teknike të funksionimit të këtij mekanizmi. Natyrisht, në jetën reale, një situatë e tillë nuk ndodh, por për demonstruese të funksionalitetit, ajo është më e përshtatshme.

Le të marrim një hartim për leximin e dy tabelave në një bazë të vetme të dhënash Oracle. Dhe rezultatet e leximit le të regjistrohen në një tabelë në të njëjtën bazë. Skema e hartimit do të duket kështu:

Si qĂ« tĂ« transferoni, eksportoni dhe integroni tĂ« dhĂ«na shumĂ« tĂ« mĂ«dha nĂ« mĂ«nyrĂ« tĂ« lirĂ« dhe tĂ« shpejtĂ«? ÇfarĂ« Ă«shtĂ« optimizimi pushdown?

Në formën e hartimit në Informatica BDM 10.2.1, kjo duket kështu:

Si qĂ« tĂ« transferoni, eksportoni dhe integroni tĂ« dhĂ«na shumĂ« tĂ« mĂ«dha nĂ« mĂ«nyrĂ« tĂ« lirĂ« dhe tĂ« shpejtĂ«? ÇfarĂ« Ă«shtĂ« optimizimi pushdown?

Tipi pushdown – native

Nëse ne zgjedhim tipin pushdown native, atëherë hartimi do të ekzekutohet në server Informatica. Të dhënat do të lexohen nga serveri Oracle, do të transferohen në serverin Informatica, do të transformohen atje dhe do të dërgohen në Hadoop. Në fjalë të tjera, do të marrim një proces të zakonshëm ETL.

Tipi pushdown – source

Kur zgjidhim tipin source, ne fitojmë mundësinë për të shpërndarë procesin tonë midis server bazave të të dhënave (DB) dhe Hadoop. Në ekzekutimin e procesit me këtë cilësim, kërkesat për marrjen e të dhënave nga tabelat do të fluturojnë në bazë. Ndërsa e gjithë pjesa tjetër do të ekzekutohet në forma hap pas hapi në Hadoop.
Skema e ekzekutimit do të duket kështu:

Si qĂ« tĂ« transferoni, eksportoni dhe integroni tĂ« dhĂ«na shumĂ« tĂ« mĂ«dha nĂ« mĂ«nyrĂ« tĂ« lirĂ« dhe tĂ« shpejtĂ«? ÇfarĂ« Ă«shtĂ« optimizimi pushdown?

MĂ« poshtĂ« – njĂ« shembull i konfigurimit tĂ« mjedisit tĂ« ekzekutimit.

Si qĂ« tĂ« transferoni, eksportoni dhe integroni tĂ« dhĂ«na shumĂ« tĂ« mĂ«dha nĂ« mĂ«nyrĂ« tĂ« lirĂ« dhe tĂ« shpejtĂ«? ÇfarĂ« Ă«shtĂ« optimizimi pushdown?

Në këtë rast, hartimi do të ekzekutohet në dy hapa. Në cilësimet e tij do të shohim që ai e ka shndërruar në një skenar, i cili do të dërgohet në burim. Dhe bashkimi i tabelave dhe transformimi i të dhënave do të kryhet në formën e një kërkese të ripërcaktuar në burim.
NĂ« imazhin mĂ« poshtĂ«, ne shohim hartimin e optimizuar nĂ« BDM, ndĂ«rsa nĂ« burim – kĂ«rkesĂ«n e ripĂ«rcaktuar.

Si qĂ« tĂ« transferoni, eksportoni dhe integroni tĂ« dhĂ«na shumĂ« tĂ« mĂ«dha nĂ« mĂ«nyrĂ« tĂ« lirĂ« dhe tĂ« shpejtĂ«? ÇfarĂ« Ă«shtĂ« optimizimi pushdown?

Roli i Hadoop nĂ« kĂ«tĂ« konfigurim do tĂ« reduktohet nĂ« menaxhimin e fluxit tĂ« tĂ« dhĂ«nave – dirigjimin e tyre. Rezultati i kĂ«rkesĂ«s do tĂ« dĂ«rgohet nĂ« Hadoop. Pas pĂ«rfundimit tĂ« leximit, skedari nga Hadoop do tĂ« regjistrohet nĂ« marrĂ«s.

Tipi pushdown – full

Kur zgjidhet tipi full, hartimi shndërrohet plotësisht në një kërkesë në DB. Dhe rezultati i kërkesës do t'i dërgohet Hadoop. Skema e këtij procesi është e paraqitur më poshtë.

Si qĂ« tĂ« transferoni, eksportoni dhe integroni tĂ« dhĂ«na shumĂ« tĂ« mĂ«dha nĂ« mĂ«nyrĂ« tĂ« lirĂ« dhe tĂ« shpejtĂ«? ÇfarĂ« Ă«shtĂ« optimizimi pushdown?

Shembulli i konfigurimit paraqitet më poshtë.

Si qĂ« tĂ« transferoni, eksportoni dhe integroni tĂ« dhĂ«na shumĂ« tĂ« mĂ«dha nĂ« mĂ«nyrĂ« tĂ« lirĂ« dhe tĂ« shpejtĂ«? ÇfarĂ« Ă«shtĂ« optimizimi pushdown?

Si rezultat, ne do të kemi një hartim të optimizuar të ngjashëm me të mëparshmin. Diferenca është se e gjithë logjika do të transferohet në marrës në formën e ripërcaktimit të futjes së tij. Shembulli i hartimit të optimizuar paraqitet më poshtë.

Si qĂ« tĂ« transferoni, eksportoni dhe integroni tĂ« dhĂ«na shumĂ« tĂ« mĂ«dha nĂ« mĂ«nyrĂ« tĂ« lirĂ« dhe tĂ« shpejtĂ«? ÇfarĂ« Ă«shtĂ« optimizimi pushdown?

Këtu, si në rastin e mëparshëm, Hadoop luan rolin e dirigjentit. Por këtu leximi i burimit bëhet tërësisht, dhe më pas në nivelin e marrësit zbatohet logjika e përpunimit të të dhënave.

Lloji pushdown – null

Dhe varianti i fundit – lloji pushdown, nĂ« tĂ« cilin mapimi ynĂ« do tĂ« shndĂ«rrohet nĂ« njĂ« skenar nĂ« Hadoop.

Mapimi i optimizuar tani do të duket kështu:

Si qĂ« tĂ« transferoni, eksportoni dhe integroni tĂ« dhĂ«na shumĂ« tĂ« mĂ«dha nĂ« mĂ«nyrĂ« tĂ« lirĂ« dhe tĂ« shpejtĂ«? ÇfarĂ« Ă«shtĂ« optimizimi pushdown?

Këtu të dhënat nga skedarët-burim fillimisht do të lexohen në Hadoop. Pastaj me mjetet e tij këta dy skedarë do të bashkohen. Pas kësaj, të dhënat do të transformohen dhe do të eksportohen në DB.

Duke kuptuar parimet e optimizimit pushdown, mund të organizoni shumë procese të punës me të dhëna të mëdha shumë efikas. Kështu, së fundmi një kompani e madhe arriti të eksportojë nga depoja në Hadoop të dhëna të mëdha, të cilat deri atëherë i kishte mbledhur për disa vite.

Burimi: habr.com

Blini hosting tĂ« besueshĂ«m pĂ«r faqe interneti me mbrojtje nga DDoS, serverĂ« VPS VDS đŸ”„ Blini hosting tĂ« besueshĂ«m pĂ«r faqe interneti me mbrojtje nga DDoS, serverĂ« VPS VDS | ProHoster