Tere, Habr!
Andmed on ettevõtte kõige väärtuslikum vara. Sellest ütleb peaaegu iga digitaalse suunaga ettevõte. Sellega on raske vaielda: andmete haldus-, säilitamis- ja töötlemismeetodite arutamiseta ei möödu ühtegi suurt IT-konverentsi.
Andmed jõuavad meieni väljast, samas kui osa neist kujuneb ettevõtte siseselt. Kui rääkida sideettevõtte andmetest, siis on need sisepersonalile aare klientide, nende huvide, harjumuste ja asukoha kohta. Õige profiilimise ja sihtimise korral toimivad reklaampakkumised kõige tõhusamalt. Kuid praktikas ei ole kõik nii roosiline. Ettevõtete hoitavad andmed võivad olla lootusetult vananenud, liigsed, korduvad või nende olemasolust ei tea keegi teine kui kitsas kasutajate rühm. ¯_(ツ)_/¯
Ühesõnaga, andmeid tuleb tõhusalt hallata – ainult nii saavad need ettevõttele tõelist kasu ja tulu toovaks varaks. Kahjuks tuleb andmete haldamise küsimuste lahendamiseks ületada palju keerukusi. Need on peamiselt tingitud ajaloolisest pärandist selliste "loomaaedade" süsteemide kujul ning ühtsete protsesside ja lähenemiste puudumisest nende haldamisel. Kuid mida tähendab "andmete haldamine"?
Just seda me allpool arutame ning räägime ka sellest, kuidas meid aitas avatud lähtekoodiga tehnoloogia.
Strateegilise andmehalduse (Data Governance, DG) kontseptsioon on Venemaa turul juba piisavalt tuntud, ja selle rakendamisega kaasnevad eesmärgid on arusaadavad ja selgelt välja kuulutatud. Meie ettevõte ei ole erand ja seadis endale eesmärgiks andmehalduse kontseptsiooni rakendamise.
Nii et, kuidas me alustasime? Kõigepealt määratlesime endale põhieesmärgid:
- Tagada meie andmete kättesaadavus.
- Tagada andmete elutsükli läbipaistvus.
- Anda ettevõtte kasutajatele kooskõlastatud ja vastuolulisi andmeid.
- Anda ettevõtte kasutajatele kontrollitud andmeid.
Praegu on turul sadu andmehalduse tarkvara tööriistu.

Kuid detailse analüüsi ja lahenduste uurimise järel leidsime enda jaoks mitmeid kriitilisi märkusi:
- Enamik tootjatest pakub ulatuslikku lahenduste komplekti, mis meie jaoks on liialdatud ja dubleerib juba olemasolevat funktsionaalsust. Pluss on ressursikasutuse poolest kallis integreerimine praegusesse IT-maastikku.
- Funktsionaalsus ja liides on mõeldud tehnoloogidele, mitte lõppkasutaja ärikasutajatele.
- Toodete madal elluviimine ja edukate rakenduste puudumine Venemaa turul.
- Tarkvara ja edasise toe kõrge hind.
Ülal nimetatud kriteeriumid ja soovitused seoses tarkvara asendamisega Venemaa ettevõtetes veensid meid liikuma oma arenduse poole avatud lähtekoodiga tehnoloogiatel. Platvormiks valisime Django – tasuta ja avatud raamistiku, mis on kirjutatud Pythonis. Nii eraldasime endale olulised moodulid, mis aitavad saavutada eeltoodud eesmärke:
- Aruannete register.
- Äripõhisõnastik.
- Tehniliste muudatuste kirjeldamise moodul.
- Andmete elutsükli kirjeldamise moodul allikast BI-tööriistani.
- Andmekvaliteedi kontrolli moodul.

Aruannete register
Suurte ettevõtete siseuuringute põhjal, andmetega seotud probleemide lahendamisel kulutavad töötajad 40–80% ajast nende otsimisele. Seetõttu seadsime endale eesmärgi teha olemasoleva aruandluse kohta teave ligipääsetavaks, mis varem oli kättesaadav ainult tellijatele. Seega lühendame uue aruandluse koostamise aega ja tagame andmete demokratiseerimise.

Aruannete register sai ühtseks aknaks aruandlusele sisedoote kasutajatelt erinevatest regioonidest, osakondadest, üksustest. See konsolideerib teavet infosüsteemide kohta, mis on loodud ettevõtte mitmetesse korporatiivsetesse andmehoidlatestse, mida Rostelecomis on palju.
Kuid register on midagi enamat kui lihtsalt kuiv koostatud aruannete nimekiri. Iga aruande jaoks pakume kasutajale vajalikku teavet iseseisvaks tutvumiseks:
- lühike aruande kirjeldus;
- andmete kättesaadavuse sügavus;
- tellija segment;
- visualiseerimistööriist;
- korporatiivse andmehoidla nimetus;
- äri funktsionaalsed nõuded;
- link aruandele;
- link ligipääsu taotlusele;
- rakendamise staatus.
Aruannete põhjal on saadaval kasutusanalüüs, ja aruanded jõuavad top nimekirja logianalüüsi alusel unikaalsete kasutajate arvu põhjal. Ja see pole veel kõik. Lisaks üldistele omadustele oleme ette näinud ka aruannete atribuutide koostise üksikasjaliku kirjelduse koos näidisarvudega ja arvutusmeetoditega. Selline detailiseeritus annab kasutajale kohe vastuse, kas aruanne on tema jaoks kasulik või mitte.
Selle mooduli arendamine oli oluline samm andmete demokraatiseerimise suunas ja vähendas oluliselt vajaliku teabe otsimise aega. Otsinguaja vähenemise kõrval vähenes ka konsultatsioonide arvu nõudmine hooldusteamilt. Tasub märkida veel üks kasulik tulemus, mille saavutamine lõpetas dubleerivate aruannete arendamise erinevate struktuuriüksuste jaoks.
Ärileksikon
Te kõik teate, et isegi sama ettevõtte piires räägib äri erinevates keeltes. Jah, kasutavad samu termineid, kuid mõistavad nende alla hoopis erinevaid asju. Seda probleemi on kutsutud lahendama ärileksikon.
Meie jaoks on ärileksikon mitte lihtsalt terminite määratluste ja arvutusmeetodite kogum. See on täisväärtuslik arenduskeskkond, terminoloogia kooskõlastamine ja kinnitamine, terminite seoste loomine teiste ettevõtte informatiivsete varadega. Enne ärileksikoni jõudmist peab termin läbi töötama kõik kooskõlastamisetapid äri tellijate ja and kvaliteedi keskusega. Alles seejärel saab ta kasutamiseks kättesaadavaks.
Nii nagu ma eespool mainisin, on selle tööriista ainulaadsus selles, et see võimaldab seoseid luua ärisõnu tasemest kuni konkreetsete kasutajaraportiteni, milles neid kasutatakse, ning isegi andmebaasi füüsiliste objektideni.

See sai võimalikuks tänu glosaaride terminite identifikaatorite kasutamisele aruannete üksikasjalikus kirjelduses registrist ja andmebaasi füüsiliste objektide kirjelduses.
Praegu on glossaaris määratletud ja kooskõlastatud enam kui 4000 mõistet. Selle kasutamine lihtsustab ja kiirendab saabuvate taotluste töötlemist ettevõtte informatsioonisüsteemides. Kui vajaliku mõõdiku on juba mõnes raportis rakendatud, näeb kasutaja kohe valmis raportite komplekti, kus see mõõdik on kasutatud, ja saab otsustada, kas olemasolevat funktsionaalsust on efektiivne uuesti kasutada või kas sellega seonduvaid minimaalset kohandamist on mõistlik teha, ilma et tuleks alustada uusi taotlusi uue raporti väljatöötamiseks.
Tehniliste transformatsioonide ja DataLineage moodul
Küsite, mis moodulid need on? Lihtsalt raporti registri ja glossaari rakendamine ei piisa, tuleb ka siduda kõik ärimõisted füüsilise andmebaasi mudeliga. Nii suudame lõpetada andme elutsükli loomise protsessi allikate süsteemidest kuni BI-visualiseerimiseni läbi kõigi andmehoidla kihtide. Teisisõnu – ehitame DataLineage'i.
Oleme loonud liidese, mille aluseks oli ettevõttes varasemalt kasutatud andmete transformatsioonireeglite ja loogika kirjeldamise formaat. Liidese kaudu sisestatakse kõik see sama info, mis varem, kuid kohustuslikuks tingimuseks sai ärigloosaari mõiste identifikaatori määramine. Nii loome me seose ärikihtide ja füüsiliste kihtide vahel.
Kellele see vajalik on? Mis ei sobinud vanas vormingus, millega töötasime mitu aastat? Kui palju on suurenenud töökoormus nõuete koostamisel? Me pidime selliste küsimustega silmitsi seisma tööriista rakendamise käigus. Siin on vastused piisavalt lihtsad – see on vajalik kõigile meile, meie ettevõtte andabüroole ja meie kasutajatele.
Tõepoolest, töötajad pidid ümber õppima, alguses tõi see kaasa väikesed tööjõu suurendused dokumentatsiooni ettevalmistamisel, kuid me saime sellest küsimusest üle. Praktika, probleemide tuvastamine ja optimeerimine tegid oma töö. Me saavutasime peamise — parandasime väljatöötatud nõuete kvaliteeti. Kohustuslikud täitmiseks mõeldud väljad, ühtlustatud kataloogid, sisendi maskid, sisse ehitatud kontrollid – see kõik tõstis dramaatiliselt transformatsioonide kirjelduste kvaliteeti. Me loobusime praktikatest anda skripte arendamise nõuetena, jagasime teadmisi, mis olid kättesaadavad vaid arendusmeeskonnale. Koostatud metaandmete alus vähendab radikaalselt regressioonianalüüsi sooritamise aega ja võimaldab kiiresti hinnata muudatuste mõju IT-maastiku igas kihis (aruanded, agregaadid, allikad).
Aga mis puutub tavalistesse aruande kasutajatesse, millised on neile eelised? A thanks to DataLineage'i koostamise võimekusele saavad meie kasutajad, isegi need, kes on kaugel SQL-ist ja teistest programmeerimiskeeltest, kiiresti teavet allikate ja objektide kohta, mille põhjal antud aruanne koostati.
Andmekvaliteedi kontrolli moodul
Kõik, millest me rääkisime ülal, et tagada andmete läbipaistvus, on ebaoluline, kui me ei mõista, et andmed, mille anname kasutajatele, on õiged. Üks meie Data Governance'i kontseptsiooni olulisi mooduleid on andmekvaliteedi kontrolli moodul.
Hetkel on see kontrollide kataloog valitud üksuste kohta. Toote arendamise lähim eesmärk on kontrollide nimekirja laiendamine ja integreerimine aruande registriga.
Mida see pakub ja kellele? Lõppkasutaja jaoks on registris kergesti kättesaadav teave aruande valmimise plaanitud ja tegelike kuupäevade kohta, töötatud kontrollide tulemused koos dünaamikaga, andmed aruandele laaditud allikate kohta.
Integreeritud tööprotsessides andmete kvaliteedi moodul tähendab meie jaoks:
- Kliendi ootuste kiire vormimine.
- Otsuste tegemine edasise andmete kasutamise osas.
- Probleemsete punktide eelneva komplekti saamine töö algfaasis regulaarsete kvaliteedikontrollide arendamiseks.
Ilma kahtluseta on need esimesed sammud täieulatusliku andmehaldusprotsessi loomisel. Me oleme aga kindlad, et ainult sihipäraselt tegeleme selle tööga, rakendades aktiivselt DataGovernance'i tööriistu töösse, tagame oma klientidele informatiivsuse, kõrge usaldusväärsuse andmete suhtes, nende hankimise läbipaistvuse ning suurendame uue funktsionaalsuse väljatöötamise kiirus.
DataOffice'i meeskond
Allikas: habr.com
