Si që të transferoni, eksportoni dhe integroni të dhëna shumë të mëdha në mënyrë të lirë dhe të shpejtë? Çfarë është optimizimi pushdown?

Çdo operacion me të dhëna të mëdha kërkon kapacitete të mëdha kompjuterike. Transferimi i zakonshëm i të dhënave nga baza në Hadoop mund të zgjasë javë ose të kushtojë si një krah avioni. A nuk doni të prisni dhe të shpenzoni? Balanconi ngarkesën mbi platforma të ndryshme. Një nga mënyrat – është optimizimi pushdown.

I kërkova trajnerit kryesor në Rusi për zhvillimin dhe administrimin e produkteve Informatica, Aleksej Ananjev, që të flasë për funksionin e optimizimit pushdown në Informatica Big Data Management (BDM). A ka ndodhur ndonjëherë të mësoni të punoni me produktet e Informatica? Me siguri Aleksej ju ka mësuar bazat e PowerCenter dhe ka shpjeguar se si të krijoni mappings.

Aleksej Ananjev, drejtues i departamentit të trajnimit DIS Group

Çfarë është pushdown?

Shumica prej jush janë të njohur me Informatica Big Data Management (BDM). Produkti mundëson integrimin e të dhënave të mëdha nga burime të ndryshme, t’i transferoni ato midis sistemeve të ndryshme, ofron akses të lehtë në to, lejon profilizimin e tyre dhe shumë më tepër.
Në duar të zotë, BDM është në gjendje të realizojë mrekulli: detyrat do të kryhen shpejt dhe me burime minimale kompjuterike.

A dëshironi edhe ju kështu? Mësoni sesi të përdorni funksionin pushdown në BDM për të shpërndarë ngarkesën kompjuterike midis platformave të ndryshme. Teknologjia pushdown lejon kthimin e mapping-ut në një skript dhe zgjedhjen e mjedisit ku do të ekzekutohet ky skript. Kjo mundësi e zgjedhjes bën të mundur kombinimin e pikave të forta të platformave të ndryshme dhe arritjen e performancës maksimale të tyre.

Për të konfigurimin e mjedisit të ekzekutimit të skriptit, duhet të zgjidhni llojin e pushdown. Skripti mund të ekzekutohet plotësisht në Hadoop ose të shpërndahet pjesërisht midis burimit dhe marrësit. Ekzistojnë 4 lloje të mundshme pushdown. Mapping-u mund të mos kthehet në skript (native). Mapping-u mund të ekzekutohet maksimalisht në burim (source) ose plotësisht në burim (full). Po ashtu, mapping-u mund të kthehet në skript Hadoop (none).

Optimizimi pushdown

Të katër llojet e përmendura mund të kombinohen në mënyra të ndryshme – optimizimi i pushdown për nevojat specifike të sistemit. Për shembull, shpesh është më e arsyeshme të nxirreni të dhënat nga baza e të dhënave duke përdorur mundësitë e saj të veta. Ndërsa transformimi i të dhënave – nga fuqitë e Hadoop-it, për të mos e ngarkuar vetë bazën.

Le të shqyrtojmë një rast kur si burimi ashtu edhe marrësi ndodhen në DB, dhe platforma e ekzekutimit të transformimeve mund të zgjidhet: në varësi të cilësimeve, kjo do të jetë Informatica, serveri i DB ose Hadoop. Ky shembull do të lejojë të kuptojmë më saktë anën teknike të funksionimit të këtij mekanizmi. Natyrisht, në jetën reale, një situatë e tillë nuk ndodh, por për demonstruese të funksionalitetit, ajo është më e përshtatshme.

Le të marrim një hartim për leximin e dy tabelave në një bazë të vetme të dhënash Oracle. Dhe rezultatet e leximit le të regjistrohen në një tabelë në të njëjtën bazë. Skema e hartimit do të duket kështu:

Si që të transferoni, eksportoni dhe integroni të dhëna shumë të mëdha në mënyrë të lirë dhe të shpejtë? Çfarë është optimizimi pushdown?

Në formën e hartimit në Informatica BDM 10.2.1, kjo duket kështu:

Si që të transferoni, eksportoni dhe integroni të dhëna shumë të mëdha në mënyrë të lirë dhe të shpejtë? Çfarë është optimizimi pushdown?

Tipi pushdown – native

Nëse ne zgjedhim tipin pushdown native, atëherë hartimi do të ekzekutohet në сервере Informatica. Të dhënat do të lexohen nga serveri Oracle, do të transferohen në serverin Informatica, do të transformohen atje dhe do të dërgohen në Hadoop. Në fjalë të tjera, do të marrim një proces të zakonshëm ETL.

Tipi pushdown – source

Kur zgjidhim tipin source, ne fitojmë mundësinë për të shpërndarë procesin tonë midis сервером bazave të të dhënave (DB) dhe Hadoop. Në ekzekutimin e procesit me këtë cilësim, kërkesat për marrjen e të dhënave nga tabelat do të fluturojnë në bazë. Ndërsa e gjithë pjesa tjetër do të ekzekutohet në forma hap pas hapi në Hadoop.
Skema e ekzekutimit do të duket kështu:

Si që të transferoni, eksportoni dhe integroni të dhëna shumë të mëdha në mënyrë të lirë dhe të shpejtë? Çfarë është optimizimi pushdown?

Më poshtë – një shembull i konfigurimit të mjedisit të ekzekutimit.

Si që të transferoni, eksportoni dhe integroni të dhëna shumë të mëdha në mënyrë të lirë dhe të shpejtë? Çfarë është optimizimi pushdown?

Në këtë rast, hartimi do të ekzekutohet në dy hapa. Në cilësimet e tij do të shohim që ai e ka shndërruar në një skenar, i cili do të dërgohet në burim. Dhe bashkimi i tabelave dhe transformimi i të dhënave do të kryhet në formën e një kërkese të ripërcaktuar në burim.
Në imazhin më poshtë, ne shohim hartimin e optimizuar në BDM, ndërsa në burim – kërkesën e ripërcaktuar.

Si që të transferoni, eksportoni dhe integroni të dhëna shumë të mëdha në mënyrë të lirë dhe të shpejtë? Çfarë është optimizimi pushdown?

Roli i Hadoop në këtë konfigurim do të reduktohet në menaxhimin e fluxit të të dhënave – dirigjimin e tyre. Rezultati i kërkesës do të dërgohet në Hadoop. Pas përfundimit të leximit, skedari nga Hadoop do të regjistrohet në marrës.

Tipi pushdown – full

Kur zgjidhet tipi full, hartimi shndërrohet plotësisht në një kërkesë në DB. Dhe rezultati i kërkesës do t'i dërgohet Hadoop. Skema e këtij procesi është e paraqitur më poshtë.

Si që të transferoni, eksportoni dhe integroni të dhëna shumë të mëdha në mënyrë të lirë dhe të shpejtë? Çfarë është optimizimi pushdown?

Shembulli i konfigurimit paraqitet më poshtë.

Si që të transferoni, eksportoni dhe integroni të dhëna shumë të mëdha në mënyrë të lirë dhe të shpejtë? Çfarë është optimizimi pushdown?

Si rezultat, ne do të kemi një hartim të optimizuar të ngjashëm me të mëparshmin. Diferenca është se e gjithë logjika do të transferohet në marrës në formën e ripërcaktimit të futjes së tij. Shembulli i hartimit të optimizuar paraqitet më poshtë.

Si që të transferoni, eksportoni dhe integroni të dhëna shumë të mëdha në mënyrë të lirë dhe të shpejtë? Çfarë është optimizimi pushdown?

Këtu, si në rastin e mëparshëm, Hadoop luan rolin e dirigjentit. Por këtu leximi i burimit bëhet tërësisht, dhe më pas në nivelin e marrësit zbatohet logjika e përpunimit të të dhënave.

Lloji pushdown – null

Dhe varianti i fundit – lloji pushdown, në të cilin mapimi ynë do të shndërrohet në një skenar në Hadoop.

Mapimi i optimizuar tani do të duket kështu:

Si që të transferoni, eksportoni dhe integroni të dhëna shumë të mëdha në mënyrë të lirë dhe të shpejtë? Çfarë është optimizimi pushdown?

Këtu të dhënat nga skedarët-burim fillimisht do të lexohen në Hadoop. Pastaj me mjetet e tij këta dy skedarë do të bashkohen. Pas kësaj, të dhënat do të transformohen dhe do të eksportohen në DB.

Duke kuptuar parimet e optimizimit pushdown, mund të organizoni shumë procese të punës me të dhëna të mëdha shumë efikas. Kështu, së fundmi një kompani e madhe arriti të eksportojë nga depoja në Hadoop të dhëna të mëdha, të cilat deri atëherë i kishte mbledhur për disa vite.

Burimi: habr.com

Blini hostim të besueshëm për faqe interneti me mbrojtje DDoS, serverë VPS VDS 🔥 Blini hostim të besueshëm për faqe interneti me mbrojtje DDoS, serverë VPS VDS - ProHoster