Kuidas käituda, kui teie ettevõtte mastaabid on suured. Ab Initio kasutamine Hive'i ja GreenPlum'i puhul

Mõni aeg tagasi seisime silmitsi ETL-tööriista valiku küsimusega BigData töötlemiseks. Varem kasutatud lahendus Informatica BDM ei rahuldanud meid piiratud funktsionaalsuse tõttu. Selle kasutamine piirdus põhimõtteliselt spark-submit käskude käivitamise raamistikuga. Turul ei olnud palju sarnaseid lahendusi, mis suudaksid töötada selliste andmemahtudega, millega me igapäevaselt toimetame. Lõpuks valisime Ab Initio. Pilootdemonstratsioonide käigus näitas toode väga suurt andmete töötlemise kiirus. Ab Initio kohta on vene keeles peaaegu mitte mingit teavet, nii et otsustasime jagada oma kogemusi Habr'is.

Ab Initio omab palju klassikalisi ja ebatavalisi transformatsioone, mille kood võib olla laiendatav oma PDL keele abil. Väikeettevõtte jaoks võib see võimas tööriist olla ilmselt liiga üle jõu käiv, ning enamik selle võimalustest võib osutuda kalliks ja kasutamatuks. Kuid kui teie mahud lähevad sarnaseks Sberbanki omadustega, võib Ab Initio teile huvi pakkuda.

See toetab äri globaalselt teadmisi koguma ja ökosüsteemi arendama, samas kui arendaja saab oma oskusi ETL-is täiendada, oma shell-teadmisi parandada, võimaldab PDL-keelt õppida, annab visuaalse ülevaate laadimisprotsessidest ning lihtsustab arendust tänu rohketele funktsionaalsetele komponentidele.

Postituses räägin Ab Initio võimalustest ja toon välja võrdlevad omadused selle töö kohta Hive'i ja GreenPlumiga.

  • MDW raamistik ja tööd selle kohandamiseks GreenPlumile
  • Ab Initio võrreldavad jõudlusomadused Hive'i ja GreenPlumiga töötamisel
  • Ab Initio töö GreenPlumiga Near Real Time režiimis


Selle toote funktsionaalsus on väga lai ja nõuab õppimiseks märkimisväärselt aega. Siiski, vajalike tööoskuste ja süsteemi õige seadistamise korral on andmete töötlemise tulemused üsna muljetavaldavad. Ab Initio kasutamine arendaja jaoks võib pakkuda huvitavat kogemust. See on uus vaatenurk ETL-arendusele, hübriid visuaalse keskkonna ja laadimise arendamise vahel skriptitaolises keeles.

Äri arendab oma ökosüsteeme ja see tööriist on sel hetkel äärmiselt kasulik. Ab Initio abil saab koguda teadmisi praeguse äri kohta ja neid teadmisi kasutada vanade laiendamiseks ja uute avamiseks. Ab Initio alternatiividena võib nimetada visuaalse arenduse keskkondi, nagu Informatica BDM, ning mittevisuaalseid keskkondi nagu Apache Spark.

Ab Initio kirjeldus

Ab Initio, nagu teised ETL tööriistad, on tootegrupp.

Kuidas käituda, kui teie ettevõtte mastaabid on suured. Ab Initio kasutamine Hive'i ja GreenPlum'i puhul

Ab Initio GDE (Graphical Development Environment) on arendaja keskkond, kus ta seadistab andmete transformatsioone ja ühendab neid andmevoogudega noolte kujul. Sellist transformatsioonide kogumit nimetatakse graafiks:

Kuidas käituda, kui teie ettevõtte mastaabid on suured. Ab Initio kasutamine Hive'i ja GreenPlum'i puhul

Funktsionaalsete komponentide sisenemise ja väljundi ühendused on pordid ja sisaldavad arvutatud välju transformatsioonide sees. Mitmed graafikud, mis on ühendatud nooltega nende täitmise järjekorras, nimetatakse plaaniks.

Saab on mitu sada funktsionaalset komponenti, mis on väga palju. Paljusid neist kasutatakse spetsiifiliselt. Klassikaliste transformatsioonide võimalused Ab Initios on laiemad kui teistes ETL-töötlustes. Näiteks Join'il on mitu väljundit. Lisaks dataste ühendamise tulemusele saab väljundiks saada ka sissetulevate dataste kirjeid, mille alustel ei õnnestunud ühendada. Samuti on võimalik saada reject'e, vigu ja transformatsiooni töö logi, mida saab lugeda samas graafikus tekstifailina ning töödelda teiste transformatsioonidega.

Kuidas käituda, kui teie ettevõtte mastaabid on suured. Ab Initio kasutamine Hive'i ja GreenPlum'i puhul

Või näiteks võib andmete vastuvõtjat materialiseerida tabelina ning samas graafikus lugeda selle andmeid.

On originaalsed transformatsioonid. Näiteks transformatsioon Scan omab funktsionaalsust nagu analüütilised funktsioonid. On transformatsioonid, millel on kõnekeelsed nimed: Create Data, Read Excel, Normalize, Sort within Groups, Run Program, Run SQL, Join with DB jne. Graafikutes võib kasutada käitamisparameetreid, sealhulgas on võimalik edastada parameetreid operatsioonisüsteemist või operatsioonisüsteemi. Valmis parameetrite kogumite failid, mis edastatakse graafikule, nimetatakse parameter sets (psets).

Nagu ikka, on Ab Initio GDE-l oma register, mida nimetatakse EME (Enterprise Meta Environment). Arendajatel on võimalus töötada kohalike koodiversioonidega ja salvestada oma arengud keskregisterisse.

Võimalus on graafiku ajal või pärast selle täitmist klõpsata igal ühendaval transforatsioonivoos ja vaadata andmeid, mis on läbinud need transformatsioonid:

Kuidas käituda, kui teie ettevõtte mastaabid on suured. Ab Initio kasutamine Hive'i ja GreenPlum'i puhul

Samuti on võimalik klõpsata igal voolul ja vaadata jälgimise detaile – mitu paralleeli transformatsioon töötas, kui palju ridu ja tariifide baidu laaditi sisse igas paralleelis:

Kuidas käituda, kui teie ettevõtte mastaabid on suured. Ab Initio kasutamine Hive'i ja GreenPlum'i puhul

On võimalus jagada graafiku täitmine faasideks ja märkida, milliseid transformatsioone tuleb täita esmalt (nullfaasis), järgmised esimeses ja teised teises faasis jne.

Iga transformatsiooni puhul on võimalik valida nn paigutus (kus see täidetakse): ilma paralleelideta või paralleelsetes voogudes, mille arvu saab seadistada. Samuti saab Ab Initio töötluste käigus loodud ajutised failid paigutada nii failisüsteemi serverid, kui ka HDFS-isse.

Igas transformatsioonis, mis põhineb vaikešablonil, on võimalik luua oma PDL-keeles skript, mis meenutab veidi shell'i.

PDL-keele abil saate laiendada transformatsioonide funktsionaalsust ning eelkõige luua dünaamiliselt (täitmise ajal) suvalisi koodifragmentide genereerimise sõltuvalt täitmise parameetritest.

Samuti on Ab Initios hästi arenenud integratsioon OS-iga shell'i kaudu. Spetsiaalselt Sberbankis kasutatakse linux ksh. Võimalik on vahetada shell'iga muudatusi ja kasutada neid graafide parameetritena. Shell'ist on võimalik kutsuda esile Ab Initio graafide täideviimist ja hallata Ab Initio't.

Lisaks Ab Initio GDE-le sisaldab tarnet palju teisi tooteid. Seal on oma Co>Operation System, mis pretendeerib operatsioonisüsteemiks. On Control>Center, kus saab graafikule seada ja jälgida laadimisvooge. On tooted, mis võimaldavad arendust palju primitiivsemal tasemel kui Ab Initio GDE võimaldab.

MDW raamistik ja tööd selle kohandamiseks GreenPlumile

Koos oma toodetega pakub tarnija MDW (Metadata Driven Warehouse) toodet, mis on graafide konfigureerija, loodud andmehoidlate või data vaultide täitmise tüüpiliste ülesannete aitamiseks.

See sisaldab kasutaja (projekti spetsiifilisi) metaandmete parsijaid ja valmis koodigeneraatorit „karbist välja”.

Kuidas käituda, kui teie ettevõtte mastaabid on suured. Ab Initio kasutamine Hive'i ja GreenPlum'i puhul
MDW saab sisendiks andmemudeli, konfiguratsioonifaili andmebaasiga (Oracle, Teradata või Hive) ühenduse seadistamiseks ja mõned muud seaded. Projekti spetsiifiline osa, näiteks rakendab mudeli andmebaasi. Tootetooted genereerivad graafid ja nendega seotud seadistusteaded mudeli tabelitesse andmete laadimise käigus. Samuti luuakse graafid (ja pset'id) mitmete algse ja inkrementaalse tegevuse laadimise režiimide jaoks.

Hive'i ja RDBMS-i korral genereeritakse erinevad graafid algse ja inkrementaalse andmete värskendamise jaoks.

Hive'i puhul liidetakse saadud delta andmed Ab Initio Join'i kaudu varasemate tabelis olnud andmetega. MDW andmeedastajad (nii Hive'is kui RDBMS-is) mitte ainult ei sisalda uusi delta andmeid, vaid sulgevad ka andmete kehtivuse perioodid, mis põhinevad peamistel võtmetel, mille kaudu delta saabus. Lisaks tuleb uuesti kirjutada muutumatud andmete osad. Kuid see on vajalik, kuna Hive'is ei ole delete või update toiminguid.

Kuidas käituda, kui teie ettevõtte mastaabid on suured. Ab Initio kasutamine Hive'i ja GreenPlum'i puhul

RDBMS-i puhul näevad andmete järkjärguline uuendamine välja optimaalselt, kuna RDBMS-idel on reaalne uuendamise võimalus.

Kuidas käituda, kui teie ettevõtte mastaabid on suured. Ab Initio kasutamine Hive'i ja GreenPlum'i puhul

Saadud delta laaditakse vahe tabelisse andmebaasis. Pärast seda ühendatakse delta varasemate tabelis olnud andmetega. Ja see toimub SQL'i abiga genereeritud SQL-päringu kaudu. Edasi toimub delete+insert SQL-käskude abil uute delta andmete sisestamine sihttabelisse ja andmete kehtivuse perioodide sulgemine, mille peamiste võtmete kaudu delta saabus.
Muutumatute andmete uuesti kirjutamine ei ole vajalik.

Seega jõudsime järeldusele, et Hive'i puhul peab MDW kogu tabeli ümber kirjutama, kuna Hive'il puudub uuendamise funktsioon. Täielik andmete ümberkirjutamine uuendamise puhul on parim lahendus.

Sberbanki projekti jaoks loome uue korduvkasutatava andmebaasi laadija teostuse GreenPlum'ile. See põhineb versioonil, mille MDW genereerib Teradata jaoks. Just Teradata, mitte Oracle, sobis paremini, kuna see on samuti MPP-süsteem. Töömeetodid ja Teradata ning GreenPlum'i süntaks osutusid sarnasteks.

MDW jaoks kriitilised erinevused erinevate RDBMS-ide vahel on järgmised. GreenPlum'is, erinevalt Teradata'st, tuleb tabelite loomisel kirjutada klausli

distributed by

Teradata's kirjutatakse

kustuta <table> all

, aga GreenPlum'is kirjutatakse

kustuta <table>

Oracle'is optimeerimise eesmärgil kirjutatakse

delete from t where rowid in ()

, aga Teradata's ja GreenPlum'is kirjutatakse

delete from t where exists (select * from delta where delta.pk=t.pk)

Üks oluline tähelepanek on see, et Ab Initio töötamiseks GreenPlumiga tuli installida GreenPlumi klient kõikidele Ab Initio klastrinoodidele. See on vajalik, kuna me ühendasime GreenPlumiga samaaegselt kõikide meie klastri sõlmede kaudu. Ja et andmete lugemine GreenPlumist oleks paralleelne ning iga paralleelne Ab Initio voog saaks lugeda oma andmepartii GreenPlumist, tuli SQL-päringute «where» sektsiooni lisada Ab Initio-se arusaadav konstruktsioon.

where ABLOCAL()

ja määrata selle konstruktsiooni väärtus, viidates DB-lt lugedes muundamise parameetrile

ablocal_expr="string_concat("mod(t.", string_filter_out("{$TABLE_KEY}","{}"), ",", (decimal(3))(number_of_partitions()), ")=", (decimal(3))(this_partition()))"

, mis kompileerub millekski sarnaseks

mod(sk,10)=3

, st peab GreenPlumile andma igasuguse filtri iga partitsiooni jaoks. Muude andmebaaside (Teradata, Oracle) puhul saab Ab Initio seda paralleelset töötlemist automaatselt teostada.

Ab Initio võrreldavad jõudlusomadused Hive'i ja GreenPlumiga töötamisel

Sberbankis viidi läbi katse, et võrrelda Hive'i ja GreenPlumi genereeritud MDW graafide tulemuslikkust. Katse käigus oli Hive'il 5 sõlme samas klastris kui Ab Initio, samas kui GreenPlumil oli 4 sõlme eraldi klastris. See tähendab, et Hive'il oli teatav eelis GreenPlumi ees "rauda“ arvestades.

Vaatluse all oli kaks graafide paari, mis täidavad sama andmete värskendamise ülesannet Hive'is ja GreenPlumis. Samuti käivitati graafid, mille oli genereerinud MDW konfigureerija:

  • alglaadimine + juhuslikult genereeritud andmete inkrementaalne laadimine Hive'i tabelisse
  • alglaadimine + juhuslikult genereeritud andmete inkrementaalne laadimine samasse tabelisse GreenPlumis

Mõlemas kohas (Hive'is ja GreenPlumis) käivitati laadimised 10 paralleelses voos samas Ab Initio klastris. Vaheandmeid Ab Initio arvutamiseks salvestati HDFS-sse (Ab Initio tingimustes kasutati HDFS-i MFS paigutust). Üks rida juhuslikult genereeritud andmeid võttis mõlemas kohas 200 baiti.

Tulemus oli järgmine:

Hive:

Alglaadimine Hive'is

Sisestatud rida
6 000 000
60 000 000
600 000 000

Initsialiseerimise kestus
laadimine sekundites
41
203
1 601

Inkrementaalne laadimine Hive'is

Reede ridade arv, mis olid
sihttabletis eksperimenti alguses
6 000 000
60 000 000
600 000 000

Delta ridade arv, mis rakendati
sihttabletile eksperimendi käigus
6 000 000
6 000 000
6 000 000

Inkrementaalse laadimise kestus
laadimine sekundites
88
299
2 541

GreenPlum:

Initsialiseerimise laadimine GreenPlum'is

Sisestatud rida
6 000 000
60 000 000
600 000 000

Initsialiseerimise kestus
laadimine sekundites
72
360
3 631

Inkrementaalne laadimine GreenPlum'is

Reede ridade arv, mis olid
sihttabletis eksperimenti alguses
6 000 000
60 000 000
600 000 000

Delta ridade arv, mis rakendati
sihttabletile eksperimendi käigus
6 000 000
6 000 000
6 000 000

Inkrementaalse laadimise kestus
laadimine sekundites
159
199
321

Nägime, et initsialiseerimise laadimise kiirus nii Hive'is kui ka GreenPlum'is sõltub lineaarselt andmete mahust ja parema riistvara tõttu on see Hive'is veidi kiirem kui GreenPlum'is.

Inkrementaalne laadimine Hive'is sõltub samuti lineaarselt sihttabletis eelnevalt laetud andmete mahust ja toimub piisavalt aeglaselt mahuga suurenemisega. See on tingitud vajadusest täielikult sihttablett uuesti kirjutada. See tähendab, et väikeste muudatuste rakendamine suurtele tabelitele ei ole Hive'i jaoks väga hea kasutusvariant.

GreenPlum'i inkrementaalne laadimine sõltub vähe sihtmärgi tabelis varasemalt laaditud andmete mahust ja toimub piisavalt kiiresti. See on võimalik SQL JOIN-de ja GreenPlum'i arhitektuuri tõttu, mis võimaldab kustutamisoperatsiooni.

Seega sissetoodab GreenPlum deltat meetodiga delete+insert, kuid Hive'is ei ole kustutamis- ega uuendamisoperatsioone, mistõttu pidi kogu andmehmotiik inkrementaalse uuendamise korral täielikult kirjutama. Kõige ilmsem on rasvase tekstiga esile tõstetud lahtrite võrdlemine, sest see vastab kõige sagedasemale ressursimahukate laadimisoperatsioonide kasutusviisile. Näeme, et GreenPlum võitis selle testi Hive'ist 8 korda.

Ab Initio töö GreenPlumiga Near Real Time režiimis

Selles katses kontrollime Ab Initio suutlikkust uuendada GreenPlum'i tabelit juhuslikult genereeritud andmeportjonite abil sisuliselt reaalajas. Vaatleme tabelit GreenPlum dev42_1_db_usl.TESTING_SUBJ_org_finval, millega tööd alustatakse.

Kasutame kolme Ab Initio graafi selle töötlemiseks:

1) Graaf Create_test_data.mp – loob 10 paralleelses voos faile HDFS-is, mis sisaldavad 6 000 000 rida andmeid. Andmed on juhuslikud, nende struktuur on korraldatud meie tabelisse sisestamiseks.

Kuidas käituda, kui teie ettevõtte mastaabid on suured. Ab Initio kasutamine Hive'i ja GreenPlum'i puhul

Kuidas käituda, kui teie ettevõtte mastaabid on suured. Ab Initio kasutamine Hive'i ja GreenPlum'i puhul

2) Graaf mdw_load.day_one.current.dev42_1_db_usl_testing_subj_org_finval.pset – genereeritud MDW graaf meie tabelisse andmete algse lisamise jaoks 10 paralleelses voos (kasutatakse graafi (1) genereeritud testandmeid)

Kuidas käituda, kui teie ettevõtte mastaabid on suured. Ab Initio kasutamine Hive'i ja GreenPlum'i puhul

3) Graaf mdw_load.regular.current.dev42_1_db_usl_testing_subj_org_finval.pset – genereeritud MDW graaf meie tabeli inkrementaalse uuendamise jaoks 10 paralleelses voos värskete saabuvate andmete (deltad) kasutamisel, genereeritud graafi (1) poolt

Kuidas käituda, kui teie ettevõtte mastaabid on suured. Ab Initio kasutamine Hive'i ja GreenPlum'i puhul

Käivitame alltoodud stsenaariumi NRT-režiimis:

  • genereerida 6 000 000 testirida
  • teha alglaadimine, sisestada 6 000 000 testirida tühja tabelisse
  • korrata 5 korda inkrementaalset laadimist
    • genereerida 6 000 000 testirida
    • teha inkrementaalne sisestamine 6 000 000 testirida tabelisse (samal ajal määratakse vanadele andmetele aegumise aeg valid_to_ts ja sisestatakse uuemad andmed sama peamise võtmega)

Selline stsenaarium emuleerib teatud ärisüsteemi reaalajas töötamise režiimi – reaalajas ilmub piisavalt mahukas kogus uusi andmeid ja voolab kohe GreenPlumi.

Nüüd vaatame stsenaariumi töölogi:

Alustage Create_test_data.input.pset 2020-06-04 11:49:11
Lõpetage Create_test_data.input.pset 2020-06-04 11:49:37
Alustage mdw_load.day_one.current.dev42_1_db_usl_testing_subj_org_finval.pset 2020-06-04 11:49:37
Lõpetage mdw_load.day_one.current.dev42_1_db_usl_testing_subj_org_finval.pset 2020-06-04 11:50:42
Alustage Create_test_data.input.pset 2020-06-04 11:50:42
Lõpetage Create_test_data.input.pset 2020-06-04 11:51:06
Alustage mdw_load.regular.current.dev42_1_db_usl_testing_subj_org_finval.pset 2020-06-04 11:51:06
Lõpetage mdw_load.regular.current.dev42_1_db_usl_testing_subj_org_finval.pset 2020-06-04 11:53:41
Alustage Create_test_data.input.pset 2020-06-04 11:53:41
Lõpetage Create_test_data.input.pset 2020-06-04 11:54:04
Alustage mdw_load.regular.current.dev42_1_db_usl_testing_subj_org_finval.pset 2020-06-04 11:54:04
Lõpetage mdw_load.regular.current.dev42_1_db_usl_testing_subj_org_finval.pset 2020-06-04 11:56:51
Alustage Create_test_data.input.pset 2020-06-04 11:56:51
Lõpetage Create_test_data.input.pset 2020-06-04 11:57:14
Alustage mdw_load.regular.current.dev42_1_db_usl_testing_subj_org_finval.pset 2020-06-04 11:57:14
Lõpetage mdw_load.regular.current.dev42_1_db_usl_testing_subj_org_finval.pset 2020-06-04 11:59:55
Alustage Create_test_data.input.pset 2020-06-04 11:59:55
Lõpetage Create_test_data.input.pset 2020-06-04 12:00:23
Alustage mdw_load.regular.current.dev42_1_db_usl_testing_subj_org_finval.pset 2020-06-04 12:00:23
Lõpetage mdw_load.regular.current.dev42_1_db_usl_testing_subj_org_finval.pset 2020-06-04 12:03:23
Alustage Create_test_data.input.pset 2020-06-04 12:03:23
Lõpetage Create_test_data.input.pset 2020-06-04 12:03:49
Alustage mdw_load.regular.current.dev42_1_db_usl_testing_subj_org_finval.pset 2020-06-04 12:03:49
Lõpetage mdw_load.regular.current.dev42_1_db_usl_testing_subj_org_finval.pset 2020-06-04 12:06:46

Kujuneb selline pilt:

Diagramm
Algusaeg
Lõpetamise aeg
Pikkus

Create_test_data.input.pset
04.06.2020 11:49:11
04.06.2020 11:49:37
00:00:26

mdw_load.day_one.current.
dev42_1_db_usl_testing_subj_org_finval.pset
04.06.2020 11:49:37
04.06.2020 11:50:42
00:01:05

Create_test_data.input.pset
04.06.2020 11:50:42
04.06.2020 11:51:06
00:00:24

mdw_load.regular.current.
dev42_1_db_usl_testing_subj_org_finval.pset
04.06.2020 11:51:06
04.06.2020 11:53:41
00:02:35

Create_test_data.input.pset
04.06.2020 11:53:41
04.06.2020 11:54:04
00:00:23

mdw_load.regular.current.
dev42_1_db_usl_testing_subj_org_finval.pset
04.06.2020 11:54:04
04.06.2020 11:56:51
00:02:47

Create_test_data.input.pset
04.06.2020 11:56:51
04.06.2020 11:57:14
00:00:23

mdw_load.regular.current.
dev42_1_db_usl_testing_subj_org_finval.pset
04.06.2020 11:57:14
04.06.2020 11:59:55
00:02:41

Create_test_data.input.pset
04.06.2020 11:59:55
04.06.2020 12:00:23
00:00:28

mdw_load.regular.current.
dev42_1_db_usl_testing_subj_org_finval.pset
04.06.2020 12:00:23
04.06.2020 12:03:23
00:03:00

Create_test_data.input.pset
04.06.2020 12:03:23
04.06.2020 12:03:49
00:00:26

mdw_load.regular.current.
dev42_1_db_usl_testing_subj_org_finval.pset
04.06.2020 12:03:49
04.06.2020 12:06:46
00:02:57

Nägime, et 6 000 000 rida inkrementi töödeldakse 3 minutiga, mis on piisavalt kiire.
Sihttäidetud tabelis on andmed jaotatud järgmiselt:

select valid_from_ts, valid_to_ts, count(1), min(sk), max(sk) from dev42_1_db_usl.TESTING_SUBJ_org_finval group by valid_from_ts, valid_to_ts order by 1,2;

Kuidas käituda, kui teie ettevõtte mastaabid on suured. Ab Initio kasutamine Hive'i ja GreenPlum'i puhul
Saab eristada sisestatud andmete vastavust graafikute käivitamise momentidele.
See tähendab, et Ab Initios saab käivitada andmete inkrementaalset laadimist GreenPlumi väga suure sagedusega ning jälgida nende andmete kõrget sisestamiskiirust GreenPlumis. Loomulikult ei saa käivitada iga sekundi järel, kuna Ab Initio, nagu kõik ETL-tööriistad, vajab käivitamisel aega „soojenemiseks“.

Kokkuvõte

Praegu kasutatakse Ab Initio Sberbankis ühtse semantilise andmekihi (ESS) ehitamiseks. See projekt hõlmab erinevate pangaäri üksuste oleku ühtse versiooni loomist. Teave tuleb erinevatest allikatest, mille koopiad valmistatakse Hadoopis. Äri vajadustest lähtuvalt koostatakse andmemudel ja kirjeldatakse andmete transforme. Ab Initio laadib teabe ESS-i, kusjuures laaditud andmed on huvitavad mitte ainult äri jaoks, vaid teenivad ka andmevitriinide loomiseks allikana. Toote funktsionaalsus võimaldab kasutada erinevaid süsteeme (Hive, Greenplum, Teradata, Oracle) vastuvõtjana, mis võimaldab andmete valmistamist äri jaoks vajalikes formaatides ilma eriliste raskusteta.

Ab Initio võimalused on suured, näiteks kaasatud MDW raamistik võimaldab luua tehnilist ja ärilugu andmetest “karbist välja”. Ab Initio annab arendajatele võimaluse “not reinvent the wheel”, vaid kasutada mitmeid olemasolevaid funktsionaalseid komponente, mis on põhimõtteliselt vajalikud andmetega töötamiseks.

Autor on Sberbanki SberProfi DWH / BigData professionaalse kogukonna ekspert. Professionaalne SberProfi DWH / BigData kogukond vastutab oskuste arendamise eest valdkondades nagu Hadoopi ökosüsteem, Teradata, Oracle DB, GreenPlum ning BI tööriistades Qlik, SAP BO, Tableau jms.

Allikas: habr.com

Osta usaldusväärne veebihosting DDoS kaitsega, VPS VDS serverid 🔥 Osta usaldusväärne veebihosting DDoS kaitsega, VPS VDS serverid | ProHoster