Tere, Habr!
Andmed on ettevÔtte kÔige vÀÀrtuslikum vara. Sellest vÀidab peaaegu iga digitaalse suunaga ettevÔte. Sellega on raske vaielda: andmete juhtimise, sÀilitamise ja töötlemise lÀhenemisviiside arutelu on praegu iga suure IT-konverentsi lahutamatu osa.
Andmed jĂ”uavad meieni nii vĂ€ljastpoolt kui ka tekivad ettevĂ”tte sees. Kui rÀÀkida telekommunikatsiooniandmetest, siis on need sisetöötajatele allikas teavet kliendi, tema huvide, harjumuste ja asukoha kohta. Korraliku profileerimise ja segmenteerimisega on reklaamipakkumised kĂ”ige tĂ”husamad. Kuid praktikas ei ole kĂ”ik nii roosiline. Need andmed, mida ettevĂ”tted sĂ€ilitavad, vĂ”ivad olla lootusetult vanad, ĂŒlearused, korduvad vĂ”i nende olemasolust teab vaid kitsas kasutajate ring.
ÂŻ_(ă)_/ÂŻ
Just sellest me allpool rÀÀgime, samuti sellest, kuidas avatud lÀhtekoodiga tehnoloogiad meid toetavad.
Andmete strateegilise juhtimise kontseptsioon Data Governance (DG) on Venemaa turul juba hÀsti tuntud, ja selle rakendamisest saadud eesmÀrgid on ettevÔtetele selged ja tÀpselt deklareeritud. Meie ettevÔte ei ole erand ja oleme seadnud endale eesmÀrgi andmete juhtimise kontseptsiooni rakendamiseks.
Nii et kust me alustasime? Esiteks koostasime oma peamised eesmÀrgid:
- Tagada meie andmete kÀttesaadavus.
- Tagada andmete elutsĂŒkli lĂ€bipaistvus.
- Anda ettevÔtte kasutajatele kooskÔlastatud ja jÀrjepidevaid andmeid.
- Anda ettevÔtte kasutajatele kontrollitud andmeid.
Praegu on turul saadaval mitmeid Data Governance klassi tööriistu.

Kuid pĂ”hjaliku analĂŒĂŒsi ja lahenduste uurimise jĂ€rel oleme tuvastanud mitu kriitilist tĂ€helepanekut:
- Enamik tootjatest pakub laia valikut lahendusi, mis meie jaoks on liigsed ja kordavad juba olemasolevat funktsionaalsust. Lisaks on nende integreerimine praegusesse IT-maastikku ressursimahukas.
- Funktsionaalsus ja kasutajaliides on suunatud tehnoloogidele, mitte lÔppkasutajatele.
- Toodete madal kÀibesuurus ja edukate rakenduste puudumine Venemaa turul.
- Tarkvara kÔrge hind ja sellele jÀrgnev tugi.
Ălaltoodud kriteeriumid ja soovitused tarkvara impordikohtlemise osas Venemaa ettevĂ”tetele veensid meid liikuma oma arenduseni avatud lĂ€htekoodiga tehnoloogia baasil. Platvormiks valisime Django â tasuta ja avatud raamistik, mis on kirjutatud Pythonis. Nii valisime endale vĂ”tmemoodulid, mis toetavad eespool nimetatud eesmĂ€rke:
- Aruandekogu.
- Ăriglossaar.
- Tehniliste transformatsioonide kirjeldamise moodul.
- Andmete elutsĂŒkli kirjeldamise moodul allikast BI-tööriistani.
- Andmekvaliteedi kontrollimise moodul.

Aruannete register
Suurte ettevĂ”tete sisemiste uuringute pĂ”hjal kulub andmetega seotud ĂŒlesannete lahendamisel töötajatel 40â80% ajast nende otsimisele. SeetĂ”ttu oleme seadnud eesmĂ€rgiks avada teavet olemasolevate aruannete kohta, mis varem olid kĂ€ttesaadavad ainult tellijatele. Nii vĂ€hendame uute aruannete koostamise aega ja edendame andmete demokratiseerimist.

Aruannete register on muutunud ĂŒheks aruandluse aknaks erinevate piirkondade, osakondade ja allĂŒksuste sisemistele kasutajatele. See konsolideerib teavet infoteenustest, mis on loodud paljudes ettevĂ”tte andmehoidlates; neid on Rostelecomis palju.
Kuid register ei ole lihtsalt kuiv loetelu koostatud aruannetest. Iga aruande kohta pakume teavet, mida kasutaja vajab, et temaga iseseisvalt tutvuda:
- aruande lĂŒhikirjeldus;
- andmete kĂ€ttesaadavuse sĂŒgavus;
- tellija segment;
- visualiseerimise tööriist;
- korporatiivse hoidla nimetus;
- Àrifunktsionaalsed nÔuded;
- link aruandele;
- link juurdepÀÀsutaotlusele;
- rakendamise staatus.
Aruannete pĂ”hjal on saadaval kasutusanalĂŒĂŒs ning aruanded jĂ”uavad tippu unikaalsete kasutajate arvu pĂ”hjal analĂŒĂŒtika logides. Ja see pole kĂ”ik. Peale ĂŒldiste omaduste oleme vĂ€lja töötanud ka detailse kirjelduse aruannete atribuutide sisust koos nĂ€idisarvutuste ja metoodikaga. Selline detailitus annab kasutajale kohe vastuse, kas raport on talle kasulik vĂ”i mitte.
Selle mooduli vĂ€ljatöötamine on olnud oluline samm andmete demokraatiseerimise suunas ning on oluliselt vĂ€hendanud vajaliku teabe otsimise aega. Otsimise aja vĂ€henemise kĂ”rval on samuti vĂ€henenud pĂ€ringute arv tugimeeskonna poole konsultatsioonide saamiseks. Ei saa unustada ka ĂŒht kasulikku tulemust, mille oleme saavutanud ĂŒhtse aruandlusregisteri vĂ€ljatöötamisega â hinnata dubleerivate aruannete loomist erinevate struktuuriĂŒksuste jaoks.
Ărileksikon
Kogu teate, et isegi ĂŒhe ja sama ettevĂ”tte sees rÀÀgib Ă€ri erinevates keeltes. Jah, kasutatakse samu termineid, kuid nende all mĂ”istetakse tĂ€iesti erinevaid asju. Selle probleemi lahendamiseks on vajalik Ă€riglossaar.
Meie jaoks ei ole Àriglossaar lihtsalt terminite ja arvutusmetoodika kirjeldamise kataloog. See on tÀielik arenduskeskkond, kus toimub terminoloogia koostamine, kooskÔlastamine ja kinnitamine, samuti terminite omavaheliste seoste loomine teiste ettevÔtte informatsioonikapitalide vahel. Enne, kui termin jÔuab Àriglossaari, peab see lÀbima kÔik kooskÔlastamisetapid Àri tellijate ja andmekvaliteedi keskuse juures. Alles pÀrast seda on see kasutamiseks saadaval.
Nagu ma juba eelnevalt mainisin, on selle tööriista ainulaadsus selles, et see vĂ”imaldab luua seoseid Ă€risĂ”na tasemelt kuni konkreetsete kasutajaraportiteni, kus see on rakendatud, ning fĂŒĂŒsiliste andmebaasi objektide tasemeni.

See sai vĂ”imalikuks tĂ€nu glossari terminite identifikaatorite kasutamisele detailsetes kirjeldustes registrist ja fĂŒĂŒsiliste andmebaasi objektide kirjeldustes.
Praegu on glossaariumis mÀÀratletud ja kooskĂ”lastatud juba ĂŒle 4000 termini. Selle kasutamine lihtsustab ja kiirendab ettevĂ”tte infosĂŒsteemidesse esitatud muudatusettepanekute töötlemist. Kui nĂ”utud nĂ€itaja on juba mĂ”nes raportis olemas, nĂ€eb kasutaja koheselt komplekti valmis raporteid, kus see nĂ€itaja on kasutatud, ja suudab otsustada olemasoleva funktsionaalsuse tĂ”husaks uuesti kasutamiseks vĂ”i selle minimaalseteks tĂ€iendusteks, mitte kĂ€ivitades uusi taotlusi uue raporti arendamiseks.
Tehniliste transformatsioonide ja DataLineage'i kirjeldusmoodul
KĂŒsite, mis moodulid need on? Lihtsalt aruande registri ja glossaari rakendamine ei piisa, tuleb veel kĂ”ik Ă€riterminid fĂŒĂŒsilisele andmebaasimudelile kohandada. Nii suudame lĂ”petada andmete elutsĂŒkli vormimise protsessi allikate sĂŒsteemidest kuni BI-visualiseerimiseni lĂ€bi kĂ”ik andmehoidla kihid. TeisisĂ”nu â ehitada DataLineage.
Oleme töötanud vĂ€lja liidese, mis pĂ”hineb ettevĂ”ttes varasemalt kasutataval andmete töötlemise reeglite ja loogika kirjelduseformaadil. Liidese kaudu sisestatakse kĂ”ik see sama teave, mis varem, kuid nĂŒĂŒd on kohustuslik mÀÀrata terminite identifikaator Ă€riglosaarist. Nii saavutame sideme Ă€ri- ja fĂŒĂŒsiliste kihtide vahel.
Kellele see on vajalik? Mis ei sobinud vanas formaadis, millega oleme töötanud mitu aastat? Kuidas on suurenenud nĂ”uete vormimise töömaht? Nende kĂŒsimustega pidime tegelema tööriista rakendamise kĂ€igus. Siin on vastused piisavalt lihtsad â see on vajalik meile kĂ”igile, meie ettevĂ”tte andmsteenusele ning meie kasutajatele.
TĂ”epoolest, töötajad pidid kohanduma, alguses tĂ”i see kaasa vĂ€ikseid tĂ”use dokumentatsiooni ettevalmistamise tĂ”hususes, kuid selle probleemiga saime hakkama. Praktika, probleemkohtade tuvastamine ja optimeerimine tegid oma töö. Me saavutasime peamise eesmĂ€rgi â parandasime koostatud nĂ”uete kvaliteeti. Kohustuslikud tĂ€itmiseks mĂ”eldud vĂ€ljad, ĂŒhtlustatud viidikud, sisendi maskid, sisseehitatud kontrollid â kĂ”ik see vĂ”imaldas mitmekordselt parandada transformatsioonide kirjelduste kvaliteeti. Me loobusime praktikast edastada skripte arendusnĂ”uetena, jagasime teadmisi, mis olid enne kergesti kĂ€ttesaadavad ainult arendusmeeskonnale. Moodustatud metainformatsiooni baas vĂ€hendab oluliselt regressiooni analĂŒĂŒsi lĂ€biviimise aega, tagab vĂ”imaluse kiiresti hinnata muudatuste mĂ”ju mis tahes IT-maastiku kihil (aruanded, aggregeerijad, allikad).
Ja milles see tavalisest kasutajast kahes raportis kasu toob? DataLineage'i vÔimaluse abil saavad meie kasutajad, isegi need, kes ei ole SQL-i ega muude programmeerimiskeeltega tuttavad, kiiresti teavet allikate ja objektide kohta, mille pÔhjal koostatakse vastav raport.
Andmekvaliteedi kontrolli moodul
KĂ”ik, millest eespool rÀÀkisime andmete lĂ€bipaistvuse tagamise osas, pole oluline, kui me ei mĂ”ista, et andmed, mida me kasutajatele edastame, on Ă”iged. Ăks meie Data Governance'i kontseptsiooni olulisi mooduleid on andmekvaliteedi kontrolli moodul.
Praegusel etapil on see kataloog kontrollidest valikutest. Toote arendamise lÀhim eesmÀrk on kontrollide nimekirja laiendamine ja aruanne registriga integreerimine.
Mida see annab ja kellele? Registri lÔppkasutajatele on saadaval teave plaanitud ja tegelike aruande valmimise kuupÀevade, lÀbiviidud kontrollide tulemuste ja allikate kohta, mis on aruandesse laaditud.
Meie jaoks on töösse integreeritud andmekvaliteedi moodul:
- Kliendi ootuste kiire kujundamine.
- Otsusandmine edasise andmete kasutamise kohta.
- Esialgsete probleemikohaga seotud ettepanekute kogumine töö algusfaasis regulaarsete kvaliteedikontrollide jaoks.
TĂ”epoolest, need on esimesed sammud tĂ€ieliku andmehaldusprotsessi ĂŒlesehitamisel. Kuid me oleme kindlad, et ainult sihipĂ€raselt tegeldes selle tööga ja aktiivselt rakendades DataGovernance'i tööprotsessi, suudame meie klientidele pakkuda teabele baseeruvat, kĂ”rge usaldusvÀÀrsuse tasemega andmeid, nende saamise lĂ€bipaistvust ning kiirendada uue funktsionaalsuse juurutamist.
DataOffice meeskond
Allikas: habr.com
