MĂ”ni aeg tagasi seisime silmitsi ETL-tööriista valiku kĂŒsimusega BigData töötlemiseks. Varem kasutatud lahendus Informatica BDM ei rahuldanud meid piiratud funktsionaalsuse tĂ”ttu. Selle kasutamine piirdus pĂ”himĂ”tteliselt spark-submit kĂ€skude kĂ€ivitamise raamistikuga. Turul ei olnud palju sarnaseid lahendusi, mis suudaksid töötada selliste andmemahtudega, millega me igapĂ€evaselt toimetame. LĂ”puks valisime Ab Initio. Pilootdemonstratsioonide kĂ€igus nĂ€itas toode vĂ€ga suurt andmete töötlemise kiirus. Ab Initio kohta on vene keeles peaaegu mitte mingit teavet, nii et otsustasime jagada oma kogemusi Habr'is.
Ab Initio omab palju klassikalisi ja ebatavalisi transformatsioone, mille kood vĂ”ib olla laiendatav oma PDL keele abil. VĂ€ikeettevĂ”tte jaoks vĂ”ib see vĂ”imas tööriist olla ilmselt liiga ĂŒle jĂ”u kĂ€iv, ning enamik selle vĂ”imalustest vĂ”ib osutuda kalliks ja kasutamatuks. Kuid kui teie mahud lĂ€hevad sarnaseks Sberbanki omadustega, vĂ”ib Ab Initio teile huvi pakkuda.
See toetab Ă€ri globaalselt teadmisi koguma ja ökosĂŒsteemi arendama, samas kui arendaja saab oma oskusi ETL-is tĂ€iendada, oma shell-teadmisi parandada, vĂ”imaldab PDL-keelt Ă”ppida, annab visuaalse ĂŒlevaate laadimisprotsessidest ning lihtsustab arendust tĂ€nu rohketele funktsionaalsetele komponentidele.
Postituses rÀÀgin Ab Initio vÔimalustest ja toon vÀlja vÔrdlevad omadused selle töö kohta Hive'i ja GreenPlumiga.
- MDW raamistik ja tööd selle kohandamiseks GreenPlumile
- Ab Initio vÔrreldavad jÔudlusomadused Hive'i ja GreenPlumiga töötamisel
- Ab Initio töö GreenPlumiga Near Real Time reĆŸiimis
Selle toote funktsionaalsus on vĂ€ga lai ja nĂ”uab Ă”ppimiseks mĂ€rkimisvÀÀrselt aega. Siiski, vajalike tööoskuste ja sĂŒsteemi Ă”ige seadistamise korral on andmete töötlemise tulemused ĂŒsna muljetavaldavad. Ab Initio kasutamine arendaja jaoks vĂ”ib pakkuda huvitavat kogemust. See on uus vaatenurk ETL-arendusele, hĂŒbriid visuaalse keskkonna ja laadimise arendamise vahel skriptitaolises keeles.
Ări arendab oma ökosĂŒsteeme ja see tööriist on sel hetkel ÀÀrmiselt kasulik. Ab Initio abil saab koguda teadmisi praeguse Ă€ri kohta ja neid teadmisi kasutada vanade laiendamiseks ja uute avamiseks. Ab Initio alternatiividena vĂ”ib nimetada visuaalse arenduse keskkondi, nagu Informatica BDM, ning mittevisuaalseid keskkondi nagu Apache Spark.
Ab Initio kirjeldus
Ab Initio, nagu teised ETL tööriistad, on tootegrupp.

Ab Initio GDE (Graphical Development Environment) on arendaja keskkond, kus ta seadistab andmete transformatsioone ja ĂŒhendab neid andmevoogudega noolte kujul. Sellist transformatsioonide kogumit nimetatakse graafiks:

Funktsionaalsete komponentide sisenemise ja vĂ€ljundi ĂŒhendused on pordid ja sisaldavad arvutatud vĂ€lju transformatsioonide sees. Mitmed graafikud, mis on ĂŒhendatud nooltega nende tĂ€itmise jĂ€rjekorras, nimetatakse plaaniks.
Saab on mitu sada funktsionaalset komponenti, mis on vĂ€ga palju. Paljusid neist kasutatakse spetsiifiliselt. Klassikaliste transformatsioonide vĂ”imalused Ab Initios on laiemad kui teistes ETL-töötlustes. NĂ€iteks Join'il on mitu vĂ€ljundit. Lisaks dataste ĂŒhendamise tulemusele saab vĂ€ljundiks saada ka sissetulevate dataste kirjeid, mille alustel ei Ă”nnestunud ĂŒhendada. Samuti on vĂ”imalik saada reject'e, vigu ja transformatsiooni töö logi, mida saab lugeda samas graafikus tekstifailina ning töödelda teiste transformatsioonidega.

VÔi nÀiteks vÔib andmete vastuvÔtjat materialiseerida tabelina ning samas graafikus lugeda selle andmeid.
On originaalsed transformatsioonid. NĂ€iteks transformatsioon Scan omab funktsionaalsust nagu analĂŒĂŒtilised funktsioonid. On transformatsioonid, millel on kĂ”nekeelsed nimed: Create Data, Read Excel, Normalize, Sort within Groups, Run Program, Run SQL, Join with DB jne. Graafikutes vĂ”ib kasutada kĂ€itamisparameetreid, sealhulgas on vĂ”imalik edastada parameetreid operatsioonisĂŒsteemist vĂ”i operatsioonisĂŒsteemi. Valmis parameetrite kogumite failid, mis edastatakse graafikule, nimetatakse parameter sets (psets).
Nagu ikka, on Ab Initio GDE-l oma register, mida nimetatakse EME (Enterprise Meta Environment). Arendajatel on vÔimalus töötada kohalike koodiversioonidega ja salvestada oma arengud keskregisterisse.
VĂ”imalus on graafiku ajal vĂ”i pĂ€rast selle tĂ€itmist klĂ”psata igal ĂŒhendaval transforatsioonivoos ja vaadata andmeid, mis on lĂ€binud need transformatsioonid:

Samuti on vĂ”imalik klĂ”psata igal voolul ja vaadata jĂ€lgimise detaile â mitu paralleeli transformatsioon töötas, kui palju ridu ja tariifide baidu laaditi sisse igas paralleelis:

On vÔimalus jagada graafiku tÀitmine faasideks ja mÀrkida, milliseid transformatsioone tuleb tÀita esmalt (nullfaasis), jÀrgmised esimeses ja teised teises faasis jne.
Iga transformatsiooni puhul on vĂ”imalik valida nn paigutus (kus see tĂ€idetakse): ilma paralleelideta vĂ”i paralleelsetes voogudes, mille arvu saab seadistada. Samuti saab Ab Initio töötluste kĂ€igus loodud ajutised failid paigutada nii failisĂŒsteemi serverile, kui ka HDFS-isse.
Igas transformatsioonis, mis pÔhineb vaikeƥablonil, on vÔimalik luua oma PDL-keeles skript, mis meenutab veidi shell'i.
PDL-keele abil saate laiendada transformatsioonide funktsionaalsust ning eelkĂ”ige luua dĂŒnaamiliselt (tĂ€itmise ajal) suvalisi koodifragmentide genereerimise sĂ”ltuvalt tĂ€itmise parameetritest.
Samuti on Ab Initios hÀsti arenenud integratsioon OS-iga shell'i kaudu. Spetsiaalselt Sberbankis kasutatakse linux ksh. VÔimalik on vahetada shell'iga muudatusi ja kasutada neid graafide parameetritena. Shell'ist on vÔimalik kutsuda esile Ab Initio graafide tÀideviimist ja hallata Ab Initio't.
Lisaks Ab Initio GDE-le sisaldab tarnet palju teisi tooteid. Seal on oma Co>Operation System, mis pretendeerib operatsioonisĂŒsteemiks. On Control>Center, kus saab graafikule seada ja jĂ€lgida laadimisvooge. On tooted, mis vĂ”imaldavad arendust palju primitiivsemal tasemel kui Ab Initio GDE vĂ”imaldab.
MDW raamistik ja tööd selle kohandamiseks GreenPlumile
Koos oma toodetega pakub tarnija MDW (Metadata Driven Warehouse) toodet, mis on graafide konfigureerija, loodud andmehoidlate vĂ”i data vaultide tĂ€itmise tĂŒĂŒpiliste ĂŒlesannete aitamiseks.
See sisaldab kasutaja (projekti spetsiifilisi) metaandmete parsijaid ja valmis koodigeneraatorit âkarbist vĂ€ljaâ.

MDW saab sisendiks andmemudeli, konfiguratsioonifaili andmebaasiga (Oracle, Teradata vĂ”i Hive) ĂŒhenduse seadistamiseks ja mĂ”ned muud seaded. Projekti spetsiifiline osa, nĂ€iteks rakendab mudeli andmebaasi. Tootetooted genereerivad graafid ja nendega seotud seadistusteaded mudeli tabelitesse andmete laadimise kĂ€igus. Samuti luuakse graafid (ja pset'id) mitmete algse ja inkrementaalse tegevuse laadimise reĆŸiimide jaoks.
Hive'i ja RDBMS-i korral genereeritakse erinevad graafid algse ja inkrementaalse andmete vÀrskendamise jaoks.
Hive'i puhul liidetakse saadud delta andmed Ab Initio Join'i kaudu varasemate tabelis olnud andmetega. MDW andmeedastajad (nii Hive'is kui RDBMS-is) mitte ainult ei sisalda uusi delta andmeid, vaid sulgevad ka andmete kehtivuse perioodid, mis pÔhinevad peamistel vÔtmetel, mille kaudu delta saabus. Lisaks tuleb uuesti kirjutada muutumatud andmete osad. Kuid see on vajalik, kuna Hive'is ei ole delete vÔi update toiminguid.

RDBMS-i puhul nÀevad andmete jÀrkjÀrguline uuendamine vÀlja optimaalselt, kuna RDBMS-idel on reaalne uuendamise vÔimalus.

Saadud delta laaditakse vahe tabelisse andmebaasis. PĂ€rast seda ĂŒhendatakse delta varasemate tabelis olnud andmetega. Ja see toimub SQL'i abiga genereeritud SQL-pĂ€ringu kaudu. Edasi toimub delete+insert SQL-kĂ€skude abil uute delta andmete sisestamine sihttabelisse ja andmete kehtivuse perioodide sulgemine, mille peamiste vĂ”tmete kaudu delta saabus.
Muutumatute andmete uuesti kirjutamine ei ole vajalik.
Seega jĂ”udsime jĂ€reldusele, et Hive'i puhul peab MDW kogu tabeli ĂŒmber kirjutama, kuna Hive'il puudub uuendamise funktsioon. TĂ€ielik andmete ĂŒmberkirjutamine uuendamise puhul on parim lahendus.
Sberbanki projekti jaoks loome uue korduvkasutatava andmebaasi laadija teostuse GreenPlum'ile. See pĂ”hineb versioonil, mille MDW genereerib Teradata jaoks. Just Teradata, mitte Oracle, sobis paremini, kuna see on samuti MPP-sĂŒsteem. Töömeetodid ja Teradata ning GreenPlum'i sĂŒntaks osutusid sarnasteks.
MDW jaoks kriitilised erinevused erinevate RDBMS-ide vahel on jÀrgmised. GreenPlum'is, erinevalt Teradata'st, tuleb tabelite loomisel kirjutada klausli
distributed byTeradata's kirjutatakse
kustuta <table> all, aga GreenPlum'is kirjutatakse
kustuta <table>Oracle'is optimeerimise eesmÀrgil kirjutatakse
delete from t where rowid in (), aga Teradata's ja GreenPlum'is kirjutatakse
delete from t where exists (select * from delta where delta.pk=t.pk)Ăks oluline tĂ€helepanek on see, et Ab Initio töötamiseks GreenPlumiga tuli installida GreenPlumi klient kĂ”ikidele Ab Initio klastrinoodidele. See on vajalik, kuna me ĂŒhendasime GreenPlumiga samaaegselt kĂ”ikide meie klastri sĂ”lmede kaudu. Ja et andmete lugemine GreenPlumist oleks paralleelne ning iga paralleelne Ab Initio voog saaks lugeda oma andmepartii GreenPlumist, tuli SQL-pĂ€ringute «where» sektsiooni lisada Ab Initio-se arusaadav konstruktsioon.
where ABLOCAL()ja mÀÀrata selle konstruktsiooni vÀÀrtus, viidates DB-lt lugedes muundamise parameetrile
ablocal_expr="string_concat("mod(t.", string_filter_out("{$TABLE_KEY}","{}"), ",", (decimal(3))(number_of_partitions()), ")=", (decimal(3))(this_partition()))", mis kompileerub millekski sarnaseks
mod(sk,10)=3, st peab GreenPlumile andma igasuguse filtri iga partitsiooni jaoks. Muude andmebaaside (Teradata, Oracle) puhul saab Ab Initio seda paralleelset töötlemist automaatselt teostada.
Ab Initio vÔrreldavad jÔudlusomadused Hive'i ja GreenPlumiga töötamisel
Sberbankis viidi lĂ€bi katse, et vĂ”rrelda Hive'i ja GreenPlumi genereeritud MDW graafide tulemuslikkust. Katse kĂ€igus oli Hive'il 5 sĂ”lme samas klastris kui Ab Initio, samas kui GreenPlumil oli 4 sĂ”lme eraldi klastris. See tĂ€hendab, et Hive'il oli teatav eelis GreenPlumi ees "raudaâ arvestades.
Vaatluse all oli kaks graafide paari, mis tĂ€idavad sama andmete vĂ€rskendamise ĂŒlesannet Hive'is ja GreenPlumis. Samuti kĂ€ivitati graafid, mille oli genereerinud MDW konfigureerija:
- alglaadimine + juhuslikult genereeritud andmete inkrementaalne laadimine Hive'i tabelisse
- alglaadimine + juhuslikult genereeritud andmete inkrementaalne laadimine samasse tabelisse GreenPlumis
MĂ”lemas kohas (Hive'is ja GreenPlumis) kĂ€ivitati laadimised 10 paralleelses voos samas Ab Initio klastris. Vaheandmeid Ab Initio arvutamiseks salvestati HDFS-sse (Ab Initio tingimustes kasutati HDFS-i MFS paigutust). Ăks rida juhuslikult genereeritud andmeid vĂ”ttis mĂ”lemas kohas 200 baiti.
Tulemus oli jÀrgmine:
Hive:
Alglaadimine Hive'is
Sisestatud rida
6 000 000
60 000 000
600 000 000
Initsialiseerimise kestus
laadimine sekundites
41
203
1 601
Inkrementaalne laadimine Hive'is
Reede ridade arv, mis olid
sihttabletis eksperimenti alguses
6 000 000
60 000 000
600 000 000
Delta ridade arv, mis rakendati
sihttabletile eksperimendi kÀigus
6 000 000
6 000 000
6 000 000
Inkrementaalse laadimise kestus
laadimine sekundites
88
299
2 541
GreenPlum:
Initsialiseerimise laadimine GreenPlum'is
Sisestatud rida
6 000 000
60 000 000
600 000 000
Initsialiseerimise kestus
laadimine sekundites
72
360
3 631
Inkrementaalne laadimine GreenPlum'is
Reede ridade arv, mis olid
sihttabletis eksperimenti alguses
6 000 000
60 000 000
600 000 000
Delta ridade arv, mis rakendati
sihttabletile eksperimendi kÀigus
6 000 000
6 000 000
6 000 000
Inkrementaalse laadimise kestus
laadimine sekundites
159
199
321
NÀgime, et initsialiseerimise laadimise kiirus nii Hive'is kui ka GreenPlum'is sÔltub lineaarselt andmete mahust ja parema riistvara tÔttu on see Hive'is veidi kiirem kui GreenPlum'is.
Inkrementaalne laadimine Hive'is sÔltub samuti lineaarselt sihttabletis eelnevalt laetud andmete mahust ja toimub piisavalt aeglaselt mahuga suurenemisega. See on tingitud vajadusest tÀielikult sihttablett uuesti kirjutada. See tÀhendab, et vÀikeste muudatuste rakendamine suurtele tabelitele ei ole Hive'i jaoks vÀga hea kasutusvariant.
GreenPlum'i inkrementaalne laadimine sÔltub vÀhe sihtmÀrgi tabelis varasemalt laaditud andmete mahust ja toimub piisavalt kiiresti. See on vÔimalik SQL JOIN-de ja GreenPlum'i arhitektuuri tÔttu, mis vÔimaldab kustutamisoperatsiooni.
Seega sissetoodab GreenPlum deltat meetodiga delete+insert, kuid Hive'is ei ole kustutamis- ega uuendamisoperatsioone, mistÔttu pidi kogu andmehmotiik inkrementaalse uuendamise korral tÀielikult kirjutama. KÔige ilmsem on rasvase tekstiga esile tÔstetud lahtrite vÔrdlemine, sest see vastab kÔige sagedasemale ressursimahukate laadimisoperatsioonide kasutusviisile. NÀeme, et GreenPlum vÔitis selle testi Hive'ist 8 korda.
Ab Initio töö GreenPlumiga Near Real Time reĆŸiimis
Selles katses kontrollime Ab Initio suutlikkust uuendada GreenPlum'i tabelit juhuslikult genereeritud andmeportjonite abil sisuliselt reaalajas. Vaatleme tabelit GreenPlum dev42_1_db_usl.TESTING_SUBJ_org_finval, millega tööd alustatakse.
Kasutame kolme Ab Initio graafi selle töötlemiseks:
1) Graaf Create_test_data.mp â loob 10 paralleelses voos faile HDFS-is, mis sisaldavad 6 000 000 rida andmeid. Andmed on juhuslikud, nende struktuur on korraldatud meie tabelisse sisestamiseks.


2) Graaf mdw_load.day_one.current.dev42_1_db_usl_testing_subj_org_finval.pset â genereeritud MDW graaf meie tabelisse andmete algse lisamise jaoks 10 paralleelses voos (kasutatakse graafi (1) genereeritud testandmeid)

3) Graaf mdw_load.regular.current.dev42_1_db_usl_testing_subj_org_finval.pset â genereeritud MDW graaf meie tabeli inkrementaalse uuendamise jaoks 10 paralleelses voos vĂ€rskete saabuvate andmete (deltad) kasutamisel, genereeritud graafi (1) poolt

KĂ€ivitame alltoodud stsenaariumi NRT-reĆŸiimis:
- genereerida 6 000 000 testirida
- teha alglaadimine, sisestada 6 000 000 testirida tĂŒhja tabelisse
- korrata 5 korda inkrementaalset laadimist
- genereerida 6 000 000 testirida
- teha inkrementaalne sisestamine 6 000 000 testirida tabelisse (samal ajal mÀÀratakse vanadele andmetele aegumise aeg valid_to_ts ja sisestatakse uuemad andmed sama peamise vÔtmega)
Selline stsenaarium emuleerib teatud Ă€risĂŒsteemi reaalajas töötamise reĆŸiimi â reaalajas ilmub piisavalt mahukas kogus uusi andmeid ja voolab kohe GreenPlumi.
NĂŒĂŒd vaatame stsenaariumi töölogi:
Alustage Create_test_data.input.pset 2020-06-04 11:49:11
LÔpetage Create_test_data.input.pset 2020-06-04 11:49:37
Alustage mdw_load.day_one.current.dev42_1_db_usl_testing_subj_org_finval.pset 2020-06-04 11:49:37
LÔpetage mdw_load.day_one.current.dev42_1_db_usl_testing_subj_org_finval.pset 2020-06-04 11:50:42
Alustage Create_test_data.input.pset 2020-06-04 11:50:42
LÔpetage Create_test_data.input.pset 2020-06-04 11:51:06
Alustage mdw_load.regular.current.dev42_1_db_usl_testing_subj_org_finval.pset 2020-06-04 11:51:06
LÔpetage mdw_load.regular.current.dev42_1_db_usl_testing_subj_org_finval.pset 2020-06-04 11:53:41
Alustage Create_test_data.input.pset 2020-06-04 11:53:41
LÔpetage Create_test_data.input.pset 2020-06-04 11:54:04
Alustage mdw_load.regular.current.dev42_1_db_usl_testing_subj_org_finval.pset 2020-06-04 11:54:04
LÔpetage mdw_load.regular.current.dev42_1_db_usl_testing_subj_org_finval.pset 2020-06-04 11:56:51
Alustage Create_test_data.input.pset 2020-06-04 11:56:51
LÔpetage Create_test_data.input.pset 2020-06-04 11:57:14
Alustage mdw_load.regular.current.dev42_1_db_usl_testing_subj_org_finval.pset 2020-06-04 11:57:14
LÔpetage mdw_load.regular.current.dev42_1_db_usl_testing_subj_org_finval.pset 2020-06-04 11:59:55
Alustage Create_test_data.input.pset 2020-06-04 11:59:55
LÔpetage Create_test_data.input.pset 2020-06-04 12:00:23
Alustage mdw_load.regular.current.dev42_1_db_usl_testing_subj_org_finval.pset 2020-06-04 12:00:23
LÔpetage mdw_load.regular.current.dev42_1_db_usl_testing_subj_org_finval.pset 2020-06-04 12:03:23
Alustage Create_test_data.input.pset 2020-06-04 12:03:23
LÔpetage Create_test_data.input.pset 2020-06-04 12:03:49
Alustage mdw_load.regular.current.dev42_1_db_usl_testing_subj_org_finval.pset 2020-06-04 12:03:49
LÔpetage mdw_load.regular.current.dev42_1_db_usl_testing_subj_org_finval.pset 2020-06-04 12:06:46
Kujuneb selline pilt:
Diagramm
Algusaeg
LÔpetamise aeg
Pikkus
Create_test_data.input.pset
04.06.2020 11:49:11
04.06.2020 11:49:37
00:00:26
mdw_load.day_one.current.
dev42_1_db_usl_testing_subj_org_finval.pset
04.06.2020 11:49:37
04.06.2020 11:50:42
00:01:05
Create_test_data.input.pset
04.06.2020 11:50:42
04.06.2020 11:51:06
00:00:24
mdw_load.regular.current.
dev42_1_db_usl_testing_subj_org_finval.pset
04.06.2020 11:51:06
04.06.2020 11:53:41
00:02:35
Create_test_data.input.pset
04.06.2020 11:53:41
04.06.2020 11:54:04
00:00:23
mdw_load.regular.current.
dev42_1_db_usl_testing_subj_org_finval.pset
04.06.2020 11:54:04
04.06.2020 11:56:51
00:02:47
Create_test_data.input.pset
04.06.2020 11:56:51
04.06.2020 11:57:14
00:00:23
mdw_load.regular.current.
dev42_1_db_usl_testing_subj_org_finval.pset
04.06.2020 11:57:14
04.06.2020 11:59:55
00:02:41
Create_test_data.input.pset
04.06.2020 11:59:55
04.06.2020 12:00:23
00:00:28
mdw_load.regular.current.
dev42_1_db_usl_testing_subj_org_finval.pset
04.06.2020 12:00:23
04.06.2020 12:03:23
00:03:00
Create_test_data.input.pset
04.06.2020 12:03:23
04.06.2020 12:03:49
00:00:26
mdw_load.regular.current.
dev42_1_db_usl_testing_subj_org_finval.pset
04.06.2020 12:03:49
04.06.2020 12:06:46
00:02:57
NÀgime, et 6 000 000 rida inkrementi töödeldakse 3 minutiga, mis on piisavalt kiire.
SihttÀidetud tabelis on andmed jaotatud jÀrgmiselt:
select valid_from_ts, valid_to_ts, count(1), min(sk), max(sk) from dev42_1_db_usl.TESTING_SUBJ_org_finval group by valid_from_ts, valid_to_ts order by 1,2; 
Saab eristada sisestatud andmete vastavust graafikute kÀivitamise momentidele.
See tĂ€hendab, et Ab Initios saab kĂ€ivitada andmete inkrementaalset laadimist GreenPlumi vĂ€ga suure sagedusega ning jĂ€lgida nende andmete kĂ”rget sisestamiskiirust GreenPlumis. Loomulikult ei saa kĂ€ivitada iga sekundi jĂ€rel, kuna Ab Initio, nagu kĂ”ik ETL-tööriistad, vajab kĂ€ivitamisel aega âsoojenemiseksâ.
KokkuvÔte
Praegu kasutatakse Ab Initio Sberbankis ĂŒhtse semantilise andmekihi (ESS) ehitamiseks. See projekt hĂ”lmab erinevate pangaĂ€ri ĂŒksuste oleku ĂŒhtse versiooni loomist. Teave tuleb erinevatest allikatest, mille koopiad valmistatakse Hadoopis. Ări vajadustest lĂ€htuvalt koostatakse andmemudel ja kirjeldatakse andmete transforme. Ab Initio laadib teabe ESS-i, kusjuures laaditud andmed on huvitavad mitte ainult Ă€ri jaoks, vaid teenivad ka andmevitriinide loomiseks allikana. Toote funktsionaalsus vĂ”imaldab kasutada erinevaid sĂŒsteeme (Hive, Greenplum, Teradata, Oracle) vastuvĂ”tjana, mis vĂ”imaldab andmete valmistamist Ă€ri jaoks vajalikes formaatides ilma eriliste raskusteta.
Ab Initio vĂ”imalused on suured, nĂ€iteks kaasatud MDW raamistik vĂ”imaldab luua tehnilist ja Ă€rilugu andmetest âkarbist vĂ€ljaâ. Ab Initio annab arendajatele vĂ”imaluse ânot reinvent the wheelâ, vaid kasutada mitmeid olemasolevaid funktsionaalseid komponente, mis on pĂ”himĂ”tteliselt vajalikud andmetega töötamiseks.
Autor on Sberbanki SberProfi DWH / BigData professionaalse kogukonna ekspert. Professionaalne SberProfi DWH / BigData kogukond vastutab oskuste arendamise eest valdkondades nagu Hadoopi ökosĂŒsteem, Teradata, Oracle DB, GreenPlum ning BI tööriistades Qlik, SAP BO, Tableau jms.
Allikas: habr.com
