Iga tegevus suurte andmete töötlemisel nĂ”uab suuremaid arvutusvĂ”imeid. Tavaline andmete liigutamine Hadoopisse vĂ”ib vĂ”tta nĂ€dalaid vĂ”i maksta sama palju kui lennuki tiib. Kas te ei soovi oodata ja kulutada? Tasakaalustage koormus erinevate platvormide vahel. Ăks vĂ”imalus on pushdown-optimeerimine.
Palusin Venemaa juhtivalt Informatica toote arendamise ja haldamise treenerilt Alexei Ananjevilt rÀÀkida pushdown-optimeerimise funktsioonist Informatica Big Data Management (BDM) tarkvaras. Kas olete kunagi Ôppinud Informatica tooteid kasutama? TÔenÀoliselt on just Alexei rÀÀkinud teile PowerCenteri aluseid ja selgitanud, kuidas kaarte koostada.
Alexei Ananjev, DIS Groupi koolituse suuna juht
Mis on pushdown?
Paljud teist on juba tuttavad Informatica Big Data Management (BDM) tarkvaraga. See toode suudab integreerida suuri andmeid erinevatest allikatest, liigutada neid erinevate sĂŒsteemide vahel, tagada nendele lihtne ligipÀÀs, vĂ”imaldab neid profiilida ja palju muud.
Ahned kĂ€tes suudab BDM teha imesid: ĂŒlesanded tĂ€idetakse kiiresti ja minimaalsete arvutusressurssidega.
Kas soovite samuti nii? Ăppige kasutama pushdown-funktsiooni BDM-is, et jagada arvutuskoormust erinevate platvormide vahel. Pushdown-tehnoloogia vĂ”imaldab muuta kaardi skriptiks ja valida keskkonna, kus see skript kĂ€ivitatakse. See valik vĂ”imaldab kombineerida erinevate platvormide tugevusi ja saavutada nende maksimaalne jĂ”udlus.
Skripti tĂ€itmise keskkonna seadmiseks peate valima pushdown-tĂŒĂŒbi. Skript vĂ”ib olla tĂ€ielikult kĂ€ivitatud Hadoopis vĂ”i osaliselt jaotatud allika ja sihtkoha vahel. On 4 vĂ”imalikku pushdown-tĂŒĂŒpi. Kaarti ei pea muutma skriptiks (native). Kaarti saab tĂ€ita maksimaalselt allikas (source) vĂ”i tĂ€ielikult allikas (full). Samuti saab kaardi muuta Hadoopi skriptiks (none).
Pushdown-optimeerimine
Neid 4 tĂŒĂŒpi saab omavahel erinevalt kombineerida â optimeerida pushdown vastavalt sĂŒsteemi konkreetsetele vajadustele. NĂ€iteks on sageli mĂ”istlik andmeid andmebaasist vĂ€lja tĂ”mmata, kasutades selle enda vĂ”imalusi. Ja andmete töötlemine â Hadoopi jĂ”udlusega, et andmebaasi mitte ĂŒle koormata.
Vaadakem olukorda, kus nii allikas kui vastuvĂ”tja asuvad andmebaasis, ja tĂ€itmisplatvormi saab valida: olenevalt seadetest on see Informatica, andmebaasiserver vĂ”i Hadoop. See nĂ€ide vĂ”imaldab kĂ”ige tĂ€psemalt mĂ”ista selle mehhanismi tehnilist kĂŒlge. Loomulikult ei esine sellist olukorda reaalelus, kuid funktsionaalsuse demonstreerimiseks sobib see kĂ”ige paremini.
VĂ”tame mappimise kahe tabeli lugemiseks ĂŒhes Oracle andmebaasis. Ja lugemise tulemused salvestame samasse andmebaasi tabelisse. Mappimise skeem on jĂ€rgmine:

Informatica BDM 10.2.1 versioonis nÀeb see vÀlja jÀrgmiselt:

Pushdown tĂŒĂŒp â native
Kui valime pushdown native tĂŒĂŒbi, siis mappimine teostatakse serveris Informatica. Andmed loetakse Oracle serverist, kantakse Informatica serverisse, muudetakse seal ja edastatakse Hadoopisse. TeisisĂ”nu, saame tavalise ETL-protsessi.
Pushdown tĂŒĂŒp â source
Valides source tĂŒĂŒbi, saame vĂ”imaluse jagada meie protsess serverilt andmebaaside (DB) ja Hadoop vahel. Protsessi tĂ€itmisel selle seadistusega saadetakse andmebaasi pĂ€ringud tabelite andmete valimiseks. Ja ĂŒlejÀÀnu toimub Hadoopis sammudena.
TÀitmise skeem nÀeb vÀlja jÀrgmiselt:

Allpool on nÀide tÀitmisvÔimekuse seadistamisest.

Sel juhul teostatakse mappimine kahes etapis. Selle seadistustes nĂ€eme, et see on muutunud skriptiks, mis saadetakse allikale. Ăhendamine ja andmete muutmine toimub ĂŒmberkirjutatud pĂ€ringuna allikas.
Alloleval pildil nĂ€eme optimeeritud mappimist BDM-is, ja allikas on ĂŒmberkirjutatud pĂ€ring.

Hadoopi roll selles konfiguratsioonis piirdub andmevoo haldamisega â nende dirigeerimisega. PĂ€ringu tulemus suunatakse Hadoopisse. Andmete lugemise lĂ”ppedes salvestatakse fail Hadoopist vastuvĂ”tjasse.
Pushdown tĂŒĂŒp â full
Valides full tĂŒĂŒbi, muutub mappimine tĂ€ielikult andmebaasi pĂ€ringuks. Ja pĂ€ringu tulemus suunatakse Hadoopisse. Sellise protsessi skeem on esitatud allpool.

Seadistuse nÀide on esitatud allpool.

Tulemuseks saame optimeeritud mappimise, mis on sarnane eelmisele. Erinevus seisneb ainult selles, et kogu loogika kantakse vastuvĂ”tjasse ĂŒmberkirjutatud sisendi kujul. Optimeeritud mappimise nĂ€ide on esitatud allpool.

Siin, nagu eelnevas olukorras, tÀidab Hadoop dirigendi rolli. Siiski toimub allika lugemine tÀielikult ja edasi vastuvÔtja tasandil teostatakse andmete töötlemise loogika.
Pushdown tĂŒĂŒp â null
Viimane variant on pushdown tĂŒĂŒp, mille raames meie mapp muutub Hadoopi skriptiks.
Optimeeritud mapp nĂ€eb nĂŒĂŒd vĂ€lja jĂ€rgmine:

Siin loetakse andmed allikafailidest esmalt Hadoopis. SeejĂ€rel ĂŒhendatakse need kaks faili Hadoopi vahendite abil. PĂ€rast seda muudetakse andmed ja laaditakse andmebaasi.
MĂ”istes pushdown-optimiseerimise pĂ”himĂ”tteid, saab paljusid suurte andmete töötlemise protsesse vĂ€ga tĂ”husalt korraldada. NĂ€iteks hiljuti suudeti ĂŒhel suurel ettevĂ”ttel saada Hadoopist vĂ€lja suure hulga andmeid, mille kogumine oli kestnud aastaid, vaid mitme nĂ€dala jooksul.
Allikas: habr.com
