Si tĂ« transferoni, shkarkoni dhe integroni tĂ« dhĂ«na shumĂ« tĂ« mĂ«dha me pak kosto dhe shpejt? ÇfarĂ« Ă«shtĂ« optimizimi pushdown?

Çdo operacion me tĂ« dhĂ«na tĂ« mĂ«dha kĂ«rkon kapacitete tĂ« mĂ«dha llogaritĂ«se. Shkarkimi i zakonshĂ«m i tĂ« dhĂ«nave nga njĂ« bazĂ« nĂ« Hadoop mund tĂ« zgjasĂ« javĂ« ose tĂ« kushtojĂ« si njĂ« krah avioni. Nuk dĂ«shiron tĂ« presĂ«sh dhe tĂ« shpenzosh? Balanco ngarkesĂ«n nĂ« platforma tĂ« ndryshme. NjĂ« nga mĂ«nyrat Ă«shtĂ« optimizimi i pushdown.

Kërkova që trajneri kryesor në Rusi për zhvillimin dhe administrimin e produkteve Informatica, Aleksej Ananjev, të flasë për funksionin e optimizimit të pushdown në Informatica Big Data Management (BDM). A keni mësuar ndonjëherë të punoni me produktet Informatica? Me siguri Aleksej ju ka mësuar bazat e PowerCenter dhe ka shpjeguar se si ndihmohet në ndërtimin e mappimeve.

Aleksej Ananjev, drejtori i departamentit të trajnimeve në DIS Group

ÇfarĂ« Ă«shtĂ« pushdown?

Shumë prej jush tashmë janë të njohur me Informatica Big Data Management (BDM). Produkti është në gjendje të integrojë të dhëna të mëdha nga burime të ndryshme, t'i lëvizë ato midis sistemeve të ndryshme, siguron qasje të lehtë për to, lejon profilizimin e tyre dhe shumë më tepër.
Në duar të afta, BDM është në gjendje të bëjë mrekulli: detyrat do të kryhen shpejt dhe me burime të minimizuara llogaritsë.

A do dëshironi gjithashtu? Mësoni të përdorni funksionin pushdown në BDM për të shpërndarë ngarkesën e llogaritjes midis platformave të ndryshme. Teknologjia pushdown mundëson kthimin e mapimit në një skenar dhe zgjedhjen e mjedisit ku do të ekzekutohet ky skenar. Kjo mundësi zgjedhjeje lejon kombinimin e forcave të ndryshme të platformave dhe arritjen e performancës maksimale të tyre.

Për të konfiguruar mjedisin e ekzekutimit të skenarit, duhet të zgjidhni llojin e pushdown. Skripti mund të ekzekutohet plotësisht në Hadoop ose të shpërndahen pjesërisht midis burimit dhe marrësit. Ka 4 lloje të mundshme pushdown. Mapimi nuk mund të kthehet në skript (native). Mapimi mund të ekzekutohet sa më shumë që të jetë e mundur në burim (source) ose plotësisht në burim (full). Gjithashtu, mapimi mund të kthehet në skript Hadoop (none).

Optimizimi i pushdown

KĂ«to 4 lloje mund tĂ« kombinohen nĂ« mĂ«nyra tĂ« ndryshme – duke optimizuar pushdown pĂ«r nevojat specifike tĂ« sistemit. PĂ«r shembull, shpesh Ă«shtĂ« mĂ« e arsyeshme tĂ« nxirreni tĂ« dhĂ«nat nga njĂ« bazĂ« tĂ« dhĂ«nash, duke pĂ«rdorur aftĂ«sitĂ« e saj. NdĂ«rsa transformimi i tĂ« dhĂ«nave duhet tĂ« bĂ«het nga Hadoop, pĂ«r tĂ« mos e ngarkuar vetĂ« bazĂ«n e tĂ« dhĂ«nave.

Le të shqyrtojmë një rast ku si burimi ashtu edhe marrësi ndodhen në DB, dhe platforma e ekzekutimit të transformimeve mund të zgjidhet: varësisht nga cilësimet, kjo do të jetë Informatica, serveri DB ose Hadoop. Një shembull i tillë do të lejojë të kuptojmë më saktësisht aspektin teknik të funksionimit të këtij mekanizmi. Sigurisht, në jetën reale, një situatë e tillë nuk ndodh, por për të demonstruar funksionalitetin, ajo përshtatet më së miri.

Të marrim si referencë hartimin për leximin e dy tabelave në një bazë të vetme të dhënash Oracle. Dhe le t'i regjistrojmë rezultatet e leximit në një tabelë në këtë bazë. Schemi i hartimit do të jetë kështu:

Si tĂ« transferoni, shkarkoni dhe integroni tĂ« dhĂ«na shumĂ« tĂ« mĂ«dha me pak kosto dhe shpejt? ÇfarĂ« Ă«shtĂ« optimizimi pushdown?

Si hartim në Informatica BDM 10.2.1, kjo duket kështu:

Si tĂ« transferoni, shkarkoni dhe integroni tĂ« dhĂ«na shumĂ« tĂ« mĂ«dha me pak kosto dhe shpejt? ÇfarĂ« Ă«shtĂ« optimizimi pushdown?

Lloji pushdown – natyror

NĂ«se zgjedhim llojin pushdown natyror, atĂ«herĂ« hartimi do tĂ« ekzekutohet nĂ« serveri Informatica. TĂ« dhĂ«nat do tĂ« lexohen nga serveri Oracle, do tĂ« shpĂ«rndahen nĂ« serverin Informatica, do tĂ« transformohen atje dhe do t’i transferohen nĂ« Hadoop. NĂ« fjalĂ« tĂ« tjera, ne do tĂ« marrim njĂ« proces ETL tĂ« zakonshĂ«m.

Lloji pushdown – burim

Duke zgjedhur llojin burim, ne kemi mundësinë ta shpërndajmë procesin tonë midis serverin baza të dhënash (BD) dhe Hadoop. Gjatë ekzekutimit të procesit me këtë konfigurim, do të dërgohen kërkesa për të nxjerrë të dhëna nga tabelat. Ndërsa e gjithë pjesa tjetër do të realizohet në formën e hapave në Hadoop.
Schemi e ekzekutimit do të duket kështu:

Si tĂ« transferoni, shkarkoni dhe integroni tĂ« dhĂ«na shumĂ« tĂ« mĂ«dha me pak kosto dhe shpejt? ÇfarĂ« Ă«shtĂ« optimizimi pushdown?

Më poshtë është një shembull i konfigurimit të ambientit të ekzekutimit.

Si tĂ« transferoni, shkarkoni dhe integroni tĂ« dhĂ«na shumĂ« tĂ« mĂ«dha me pak kosto dhe shpejt? ÇfarĂ« Ă«shtĂ« optimizimi pushdown?

Në këtë rast, mapimi do të kryhet në dy hapa. Në cilësimet e tij do të shohim se është transformuar në një skenar, i cili do të dërgohet në burim. Gjithashtu, bashkimi i tabelave dhe transformimi i të dhënave do të realizohet në formën e një kërkese të rishkruar në burim.
NĂ« figurĂ«n mĂ« poshtĂ«, shohim njĂ« mapim tĂ« optimizuar nĂ« BDM, dhe nĂ« burim – njĂ« kĂ«rkesĂ« tĂ« rishkruar.

Si tĂ« transferoni, shkarkoni dhe integroni tĂ« dhĂ«na shumĂ« tĂ« mĂ«dha me pak kosto dhe shpejt? ÇfarĂ« Ă«shtĂ« optimizimi pushdown?

Roli i Hadoop nĂ« kĂ«tĂ« konfigurim do tĂ« reduktohet nĂ« menaxhimin e fluksit tĂ« tĂ« dhĂ«nave – orkestrimin e tyre. Rezultati i kĂ«rkesĂ«s do t'i drejtohet Hadoop. Pas pĂ«rfundimit tĂ« leximet, skedari nga Hadoop do tĂ« shkruhet nĂ« pranues.

Tipi pushdown – full

Me zgjedhjen e tipit full, mapimi do të kthehet plotësisht në një kërkesë për BD. Rezultati i kërkesës do të dërgohet në Hadoop. Schema e këtij procesi paraqitet më poshtë.

Si tĂ« transferoni, shkarkoni dhe integroni tĂ« dhĂ«na shumĂ« tĂ« mĂ«dha me pak kosto dhe shpejt? ÇfarĂ« Ă«shtĂ« optimizimi pushdown?

Shembulli i konfigurimit është paraqitur më poshtë.

Si tĂ« transferoni, shkarkoni dhe integroni tĂ« dhĂ«na shumĂ« tĂ« mĂ«dha me pak kosto dhe shpejt? ÇfarĂ« Ă«shtĂ« optimizimi pushdown?

Si përfundim, ne do të marrë një hartë të optimizuar të ngjashme me të mëparshmen. Dallimi është se e gjithë logjika do të transferohet te marrësi në formën e redefinimit të futjes së tij. Një shembull i hartës së optimizuar është paraqitur më poshtë.

Si tĂ« transferoni, shkarkoni dhe integroni tĂ« dhĂ«na shumĂ« tĂ« mĂ«dha me pak kosto dhe shpejt? ÇfarĂ« Ă«shtĂ« optimizimi pushdown?

Këtu, ashtu si në rastin e mëparshëm, Hadoop bën rolin e dirigjentit. Por këtu leximi i burimit bëhet në tërësi, dhe më tej, në nivelin e marrësit, logjika e përpunimit të të dhënave realizohet.

Tipi pushdown – null

Dhe varianti i fundit – tipi pushdown, ku harta jonĂ« do tĂ« shndĂ«rrohet nĂ« njĂ« skenar nĂ« Hadoop.

Harta e optimizuar tani do të duket kështu:

Si tĂ« transferoni, shkarkoni dhe integroni tĂ« dhĂ«na shumĂ« tĂ« mĂ«dha me pak kosto dhe shpejt? ÇfarĂ« Ă«shtĂ« optimizimi pushdown?

Këtu të dhënat nga skedarët-burim fillimisht do të lexohen në Hadoop. Më pas me mjetet e tij, këta dy skedarë do të bashkohen. Pas kësaj, të dhënat do të transformohen dhe ngarkohen në DB.

Duke kuptuar parimet e optimizimit pushdown, mund të organizoni në mënyrë shumë efikase shumë procese të punës me të dhëna të mëdha. Pra, shumë kohë më parë, një kompani e madhe përfundoi në vetëm disa javë shkarkimin e të dhënave të mëdha nga depoja në Hadoop, të cilat deri atëherë i kishte grumbulluar për disa vjet.

Burimi: habr.com

Bleni hostim tĂ« besueshĂ«m pĂ«r faqe me mbrojtje nga DDoS, serverĂ« VPS VDS đŸ”„ Bleni hostim tĂ« besueshĂ«m pĂ«r faqe me mbrojtje nga DDoS, serverĂ« VPS VDS | ProHoster