Kuidas viia, eksportida ja integreerida vÀga suuri andmeid odavalt ja kiiresti? Mis on pushdown-optimeerimine?

Iga tegevus suurte andmete töötlemisel nĂ”uab suuremaid arvutusvĂ”imeid. Tavaline andmete liigutamine Hadoopisse vĂ”ib vĂ”tta nĂ€dalaid vĂ”i maksta sama palju kui lennuki tiib. Kas te ei soovi oodata ja kulutada? Tasakaalustage koormus erinevate platvormide vahel. Üks vĂ”imalus on pushdown-optimeerimine.

Palusin Venemaa juhtivalt Informatica toote arendamise ja haldamise treenerilt Alexei Ananjevilt rÀÀkida pushdown-optimeerimise funktsioonist Informatica Big Data Management (BDM) tarkvaras. Kas olete kunagi Ôppinud Informatica tooteid kasutama? TÔenÀoliselt on just Alexei rÀÀkinud teile PowerCenteri aluseid ja selgitanud, kuidas kaarte koostada.

Alexei Ananjev, DIS Groupi koolituse suuna juht

Mis on pushdown?

Paljud teist on juba tuttavad Informatica Big Data Management (BDM) tarkvaraga. See toode suudab integreerida suuri andmeid erinevatest allikatest, liigutada neid erinevate sĂŒsteemide vahel, tagada nendele lihtne ligipÀÀs, vĂ”imaldab neid profiilida ja palju muud.
Ahned kĂ€tes suudab BDM teha imesid: ĂŒlesanded tĂ€idetakse kiiresti ja minimaalsete arvutusressurssidega.

Kas soovite samuti nii? Õppige kasutama pushdown-funktsiooni BDM-is, et jagada arvutuskoormust erinevate platvormide vahel. Pushdown-tehnoloogia vĂ”imaldab muuta kaardi skriptiks ja valida keskkonna, kus see skript kĂ€ivitatakse. See valik vĂ”imaldab kombineerida erinevate platvormide tugevusi ja saavutada nende maksimaalne jĂ”udlus.

Skripti tĂ€itmise keskkonna seadmiseks peate valima pushdown-tĂŒĂŒbi. Skript vĂ”ib olla tĂ€ielikult kĂ€ivitatud Hadoopis vĂ”i osaliselt jaotatud allika ja sihtkoha vahel. On 4 vĂ”imalikku pushdown-tĂŒĂŒpi. Kaarti ei pea muutma skriptiks (native). Kaarti saab tĂ€ita maksimaalselt allikas (source) vĂ”i tĂ€ielikult allikas (full). Samuti saab kaardi muuta Hadoopi skriptiks (none).

Pushdown-optimeerimine

Neid 4 tĂŒĂŒpi saab omavahel erinevalt kombineerida – optimeerida pushdown vastavalt sĂŒsteemi konkreetsetele vajadustele. NĂ€iteks on sageli mĂ”istlik andmeid andmebaasist vĂ€lja tĂ”mmata, kasutades selle enda vĂ”imalusi. Ja andmete töötlemine – Hadoopi jĂ”udlusega, et andmebaasi mitte ĂŒle koormata.

Vaadakem olukorda, kus nii allikas kui vastuvĂ”tja asuvad andmebaasis, ja tĂ€itmisplatvormi saab valida: olenevalt seadetest on see Informatica, andmebaasiserver vĂ”i Hadoop. See nĂ€ide vĂ”imaldab kĂ”ige tĂ€psemalt mĂ”ista selle mehhanismi tehnilist kĂŒlge. Loomulikult ei esine sellist olukorda reaalelus, kuid funktsionaalsuse demonstreerimiseks sobib see kĂ”ige paremini.

VĂ”tame mappimise kahe tabeli lugemiseks ĂŒhes Oracle andmebaasis. Ja lugemise tulemused salvestame samasse andmebaasi tabelisse. Mappimise skeem on jĂ€rgmine:

Kuidas viia, eksportida ja integreerida vÀga suuri andmeid odavalt ja kiiresti? Mis on pushdown-optimeerimine?

Informatica BDM 10.2.1 versioonis nÀeb see vÀlja jÀrgmiselt:

Kuidas viia, eksportida ja integreerida vÀga suuri andmeid odavalt ja kiiresti? Mis on pushdown-optimeerimine?

Pushdown tĂŒĂŒp – native

Kui valime pushdown native tĂŒĂŒbi, siis mappimine teostatakse serveris Informatica. Andmed loetakse Oracle serverist, kantakse Informatica serverisse, muudetakse seal ja edastatakse Hadoopisse. TeisisĂ”nu, saame tavalise ETL-protsessi.

Pushdown tĂŒĂŒp – source

Valides source tĂŒĂŒbi, saame vĂ”imaluse jagada meie protsess serverilt andmebaaside (DB) ja Hadoop vahel. Protsessi tĂ€itmisel selle seadistusega saadetakse andmebaasi pĂ€ringud tabelite andmete valimiseks. Ja ĂŒlejÀÀnu toimub Hadoopis sammudena.
TÀitmise skeem nÀeb vÀlja jÀrgmiselt:

Kuidas viia, eksportida ja integreerida vÀga suuri andmeid odavalt ja kiiresti? Mis on pushdown-optimeerimine?

Allpool on nÀide tÀitmisvÔimekuse seadistamisest.

Kuidas viia, eksportida ja integreerida vÀga suuri andmeid odavalt ja kiiresti? Mis on pushdown-optimeerimine?

Sel juhul teostatakse mappimine kahes etapis. Selle seadistustes nĂ€eme, et see on muutunud skriptiks, mis saadetakse allikale. Ühendamine ja andmete muutmine toimub ĂŒmberkirjutatud pĂ€ringuna allikas.
Alloleval pildil nĂ€eme optimeeritud mappimist BDM-is, ja allikas on ĂŒmberkirjutatud pĂ€ring.

Kuidas viia, eksportida ja integreerida vÀga suuri andmeid odavalt ja kiiresti? Mis on pushdown-optimeerimine?

Hadoopi roll selles konfiguratsioonis piirdub andmevoo haldamisega – nende dirigeerimisega. PĂ€ringu tulemus suunatakse Hadoopisse. Andmete lugemise lĂ”ppedes salvestatakse fail Hadoopist vastuvĂ”tjasse.

Pushdown tĂŒĂŒp – full

Valides full tĂŒĂŒbi, muutub mappimine tĂ€ielikult andmebaasi pĂ€ringuks. Ja pĂ€ringu tulemus suunatakse Hadoopisse. Sellise protsessi skeem on esitatud allpool.

Kuidas viia, eksportida ja integreerida vÀga suuri andmeid odavalt ja kiiresti? Mis on pushdown-optimeerimine?

Seadistuse nÀide on esitatud allpool.

Kuidas viia, eksportida ja integreerida vÀga suuri andmeid odavalt ja kiiresti? Mis on pushdown-optimeerimine?

Tulemuseks saame optimeeritud mappimise, mis on sarnane eelmisele. Erinevus seisneb ainult selles, et kogu loogika kantakse vastuvĂ”tjasse ĂŒmberkirjutatud sisendi kujul. Optimeeritud mappimise nĂ€ide on esitatud allpool.

Kuidas viia, eksportida ja integreerida vÀga suuri andmeid odavalt ja kiiresti? Mis on pushdown-optimeerimine?

Siin, nagu eelnevas olukorras, tÀidab Hadoop dirigendi rolli. Siiski toimub allika lugemine tÀielikult ja edasi vastuvÔtja tasandil teostatakse andmete töötlemise loogika.

Pushdown tĂŒĂŒp – null

Viimane variant on pushdown tĂŒĂŒp, mille raames meie mapp muutub Hadoopi skriptiks.

Optimeeritud mapp nĂ€eb nĂŒĂŒd vĂ€lja jĂ€rgmine:

Kuidas viia, eksportida ja integreerida vÀga suuri andmeid odavalt ja kiiresti? Mis on pushdown-optimeerimine?

Siin loetakse andmed allikafailidest esmalt Hadoopis. SeejĂ€rel ĂŒhendatakse need kaks faili Hadoopi vahendite abil. PĂ€rast seda muudetakse andmed ja laaditakse andmebaasi.

MĂ”istes pushdown-optimiseerimise pĂ”himĂ”tteid, saab paljusid suurte andmete töötlemise protsesse vĂ€ga tĂ”husalt korraldada. NĂ€iteks hiljuti suudeti ĂŒhel suurel ettevĂ”ttel saada Hadoopist vĂ€lja suure hulga andmeid, mille kogumine oli kestnud aastaid, vaid mitme nĂ€dala jooksul.

Allikas: habr.com

Osta usaldusvÀÀrne hostimine veebilehtede jaoks DDoS-i kaitsega, VPS VDS serverid đŸ”„ Osta usaldusvÀÀrne hostimine veebilehtede jaoks DDoS-i kaitsega, VPS VDS serverid | ProHoster