{"id":55701,"date":"2020-01-26T00:00:00","date_gmt":"2020-01-25T21:00:00","guid":{"rendered":"https:\/\/prohoster.info\/blog\/blog_prohoster\/nuzhno-li-nam-ozero-dannyh-a-chto-delat-s-hranilishhem-dannyh"},"modified":"2020-02-18T14:03:50","modified_gmt":"2020-02-18T11:03:50","slug":"nuzhno-li-nam-ozero-dannyh-a-chto-delat-s-hranilishhem-dannyh","status":"publish","type":"post","link":"https:\/\/prohoster.info\/et\/blog\/administrirovanie\/nuzhno-li-nam-ozero-dannyh-a-chto-delat-s-hranilishhem-dannyh","title":{"rendered":"Kas me vajame andmej\u00e4rve? Kuidas andmesalvestusega edasi minna?","gt_translate_keys":[{"key":"rendered","format":"text"}]},"content":{"rendered":"<p>See artikkel on minu medium'i artikli t\u00f5lge \u2014 <noindex><a rel=\"nofollow\" href=\"https:\/\/medium.com\/rock-your-data\/getting-started-with-data-lake-4bb13643f9\">Andmej\u00e4rvega tutvumise juhend<\/a><\/noindex>, mis osutus \u00fcsna populaarseks, t\u00f5en\u00e4oliselt oma lihtsuse t\u00f5ttu. Seet\u00f5ttu otsustasin selle kirjutada eesti keeles ja veidi t\u00e4iendada, et tavaline inimene, kes ei ole andmet\u00f6\u00f6tluse spetsialist, m\u00f5istaks, mis on andmehoidla (DW) ja mis on andmej\u00e4rv (Data Lake), ning kuidas need koos eksisteerivad. <\/p>\n<p>Miks ma tahtsin andmej\u00e4rve kohta kirjutada? Olen t\u00f6\u00f6tanud andmete ja anal\u00fc\u00fctikaga \u00fcle 10 aasta ning praegu t\u00f6\u00f6tan kindlasti suurte andmete kallal Amazon Alexa AI-s Cambridge'is, mis asub Bostoni l\u00e4hedal, kuigi elan ise Vancouveri saarel Victorias ja k\u00e4in sageli nii Bostonis, Seattle'is kui ka Vancouveris, ning m\u00f5nikord isegi Moskvas konverentsidel esinemas. Samuti kirjutan aeg-ajalt, kuid peamiselt inglise keeles, ja olen juba kirjutanud <noindex><a rel=\"nofollow\" href=\"https:\/\/www.amazon.com\/Dmitry-Anoshin\/e\/B01A5PVT2M\">mitmeid raamatuid<\/a><\/noindex>, mul on samuti soov jagada P\u00f5hja-Ameerika anal\u00fc\u00fctika trende ning kirjutan m\u00f5nikord <noindex><a rel=\"nofollow\" href=\"https:\/\/t.me\/rockyourdata\">Telegramis<\/a><\/noindex>.<\/p>\n<p>Olen alati t\u00f6\u00f6tanud andmehoidlate kallal ja alates 2015. aastast olen intensiivselt t\u00f6\u00f6tanud Amazon Web Servicesiga, \u00fcldiselt olen \u00fcle l\u00e4inud pilveanal\u00fc\u00fctikale (AWS, Azure, GCP). Olen j\u00e4lginud anal\u00fc\u00fctikalahenduste evolutsiooni alates 2007. aastast ning olen isegi t\u00f6\u00f6tanud andmehoidla tootem\u00fc\u00fcgis Teradata, rakendades seda Sberbankis, just siis ilmuski Big Data koos Hadoopiga. K\u00f5ik hakkasid r\u00e4\u00e4kima, et andmehoidlate ajastu on m\u00f6\u00f6das ja n\u00fc\u00fcd on k\u00f5ik Hadoopis, ning hiljem hakati r\u00e4\u00e4kima Data Lake'ist, j\u00e4lle v\u00e4ideti, et n\u00fc\u00fcd on andmehoidla t\u00f5eliselt l\u00f5ppenud. Kuid \u00f5nneks (v\u00f5ib-olla m\u00f5ne jaoks ka kahjuks, kes teenis palju raha Hadoopi seadistamise eest) pole andmehoidlad kadunud. <br \/>\n<noindex><a rel=\"nofollow\" name=\"habracut\"><\/a><\/noindex><br \/>\nSelles artiklis vaatleme, mis on andmej\u00e4rv. Artikkel on m\u00f5eldud inimestele, kellel on andmehoidlate osas v\u00e4he v\u00f5i \u00fcldse mitte kogemusi.<\/p>\n<p><img decoding=\"async\" alt=\"Kas me vajame andmej\u00e4rve? Kuidas andmesalvestusega edasi minna?\" src=\"\/wp-content\/uploads\/2020\/01\/85b3eda809ce19fc33efb2fad4e93a41.png\" style=\"display:block;margin: 0 auto;\" \/><br \/>\n<br \/>\nPildil on Bledi j\u00e4rv, see on \u00fcks mu lemmikj\u00e4rvi, kuigi olen seal k\u00e4inud vaid korra, kuid m\u00e4letan seda kogu elu. Kuid me r\u00e4\u00e4gime teisest j\u00e4rve t\u00fc\u00fcbist \u2014 andmej\u00e4rvest. V\u00f5ib-olla olete paljusid neist juba korduvalt kuulnud, kuid veel \u00fcks m\u00e4\u00e4ratlus ei tee kellelegi halba.<\/p>\n<p>Esiteks on siin k\u00f5ige populaarsemad m\u00e4\u00e4ratlused Andmej\u00e4rve kohta:<\/p>\n<blockquote><p>\u00abfailihoidla k\u00f5ikidest t\u00fc\u00fcpidest tooredate andmete, mis on kergesti anal\u00fc\u00fcsitavad organisatsioonis kellegi poolt\u00bb \u2014 Martin Fowler.<\/p><\/blockquote>\n<blockquote><p>\u00abKui te arvate, et andmevaade on veepudel \u2014 puhastatud, pakendatud ja mugavaks tarbimiseks valmis, siis andmej\u00e4rv on tohutu reservuaar veega selle looduslikus vormis. Kasutajad saavad endale vett v\u00f5tta, s\u00fcgavale sukelduda ja uurida\u00bb \u2014 James Dickson. <\/p><\/blockquote>\n<p> N\u00fc\u00fcd teame kindlasti, et andmej\u00e4rv on seotud anal\u00fc\u00fctikaga, see v\u00f5imaldab meil salvestada suuri andmemahtusid nende algses vormis ja meil on vajalik ja mugav juurdep\u00e4\u00e4s andmetele.<\/p>\n<p>Mulle meeldib sageli asju lihtsaks teha, kui ma saan keerulise termini lihtsate s\u00f5nadega selgitada, siis olen ma endale selgeks teinud, kuidas see t\u00f6\u00f6tab ja miks see vajalik on. \u00dcks kord, kui ma kaevusin iPhone'i fotogaleriisse, tuli mulle m\u00f5te, et see on t\u00f5eline andmej\u00e4rv, isegi tegin slaidi konverentside jaoks:<\/p>\n<p><img decoding=\"async\" alt=\"Kas me vajame andmej\u00e4rve? Kuidas andmesalvestusega edasi minna?\" src=\"\/wp-content\/uploads\/2020\/01\/1956ddf4091ca00f6d86c33a6780d495.png\" style=\"display:block;margin: 0 auto;\" \/><br \/>\n<br \/>\nK\u00f5ik on v\u00e4ga lihtne. Teeme telefoniga foto, foto salvestatakse telefoni ja v\u00f5ib olla salvestatud ka iCloudi (pilvesalvestusteenus). Samuti kogub telefon foto metandmeid: mis on pildil, geotag, aeg. Tulemuseks on see, et saame kasutada mugavat iPhone'i liidest, et leida oma foto ja n\u00e4eme isegi statistikat, n\u00e4iteks kui ma otsin fotosid s\u00f5naga tuli (fire), siis leian 3 fotot l\u00f5kketule pildist. Minu jaoks on see justkui Business Intelligence t\u00f6\u00f6riist, mis t\u00f6\u00f6tab v\u00e4ga kiiresti ja t\u00e4pselt. <\/p>\n<p>Ja muidugi ei tohi me unustada turvalisust (autentimine ja autoriseerimine), vastasel juhul v\u00f5ivad meie andmed kergesti avalikuks saada. On palju uudiseid suurettev\u00f5tetest ja idufirmadest, kelle andmed on ametlikult avalikuks saanud arendajate hooletuse ja lihtsate reeglite eiramise t\u00f5ttu.<\/p>\n<p>Isegi selline lihtne pilt aitab meil m\u00f5ista, mis on andmej\u00e4rv, selle erinevused traditsioonilisest andmehoidlast ja selle p\u00f5hielemendid:<\/p>\n<ol>\n<li><b>Andmete laadimine <\/b>(Ingestion) \u2014 andmej\u00e4rve peamine komponent. Andmed v\u00f5ivad j\u00f5uda andmehoidlasse kahel viisil \u2014 batch (vahetustega laadimine) ja streaming (andmevoog).<\/li>\n<li><b>Failide salvestus<\/b> (Storage) \u2014 andmej\u00e4rve peamine komponent. Me vajame, et hoidlal oleks lihtne skaleeritavus, erakordselt usaldusv\u00e4\u00e4rsus ja madal hind. N\u00e4iteks AWS-is on see S3.<\/li>\n<li><b>Kataloog ja Otsing<\/b> (Kataloog ja Otsing) \u2014 et v\u00e4ltida Meediate Pange (see on siis, kui me viskame k\u00f5ik andmed \u00fchte kuhja ja hiljem on nendega v\u00f5imatu t\u00f6\u00f6tada), peame looma metaandmete kihi andmete klassifitseerimiseks, et kasutajad saaksid kergesti leida neid andmeid, mida nad vajavad anal\u00fc\u00fcsimiseks. T\u00e4iendavalt v\u00f5ime kasutada lisalahendusi otsimiseks, n\u00e4iteks ElasticSearch. Otsing aitab kasutajal otsida vajalikke andmeid mugavate liideste kaudu.<\/li>\n<li><b>T\u00f6\u00f6tlemine<\/b> (Protsess) \u2014 see samm vastutab andmete t\u00f6\u00f6tlemise ja transformatsiooni eest. Me saame andmeid transformeerida, nende struktuure muuta, puhastada ja palju muud. <\/li>\n<li><b>Turvalisus<\/b> (Turvalisus) \u2014 on oluline kulutada aega lahenduse turvalisuse kujundamisele. N\u00e4iteks andmete kr\u00fcptimine nende s\u00e4ilitamise, t\u00f6\u00f6tlemise ja laadimise ajal. On oluline kasutada autentimise ja autoriseerimise meetodeid. Kokkuv\u00f5tteks on vajalik auditit\u00f6\u00f6riist.<\/li>\n<\/ol>\n<p>\nPraktilisest vaatenurgast v\u00f5ime iseloomustada andmej\u00e4rve kolme atribuudiga:<\/p>\n<ol>\n<li><b>Koguge ja hoidke k\u00f5ike<\/b> \u2014 andmej\u00e4rv sisaldab k\u00f5iki andmeid, nii tooreid t\u00f6\u00f6tlemata andmeid mis tahes ajavahemiku jooksul kui ka t\u00f6\u00f6deldud\/puhastatud andmeid.<\/li>\n<li><b>S\u00fcgav anal\u00fc\u00fcs<\/b> \u2014 andmej\u00e4rv v\u00f5imaldab kasutajatel andmeid uurida ja anal\u00fc\u00fcsida.<\/li>\n<li><b>Paindlik ligip\u00e4\u00e4s<\/b> \u2014 andmej\u00e4rv tagab paindliku ligip\u00e4\u00e4su erinevatele andmetele ja erinevatele stsenaariumidele.<\/li>\n<\/ol>\n<p>\nN\u00fc\u00fcd saame r\u00e4\u00e4kida andmehoidla ja andmej\u00e4rve erinevustest. Inimesed k\u00fcsivad sageli:<\/p>\n<ul>\n<li>Aga kuidas on andmehoidla olukord?<\/li>\n<li>Kas me asendame andmehoidla andmej\u00e4rvega v\u00f5i laiendame seda?<\/li>\n<li>Kas on v\u00f5imalik siiski ilma andmej\u00e4rve hakkama saada?<\/li>\n<\/ul>\n<p>\nL\u00fchidalt, selget vastust ei ole. K\u00f5ik s\u00f5ltub konkreetsest olukorrast, meeskonna oskustest ja eelarvest. N\u00e4iteks andmehoidla migreerimine Oracle'ist AWS-sse ja andmej\u00e4rve loomine Amazon'i t\u00fctarettev\u00f5tte Woot kaudu \u2014 <noindex><a rel=\"nofollow\" href=\"https:\/\/aws.amazon.com\/blogs\/big-data\/our-data-lake-story-how-woot-com-built-a-serverless-data-lake-on-aws\/\">Meie andmej\u00e4rve lugu: Kuidas Woot.com ehitas serverivaba andmej\u00e4rve AWS-is<\/a><\/noindex>. <\/p>\n<p>Teiselt poolt, Snowflake v\u00e4idab, et teie ei pea enam andmej\u00e4rve p\u00e4rast muretsema, kuna nende andmeplatvorm (kuni 2020, kui see oli andmehoidla) v\u00f5imaldab teil liita nii andmej\u00e4rve kui ka andmehoidla. Olen Snowflake'iga natuke t\u00f6\u00f6tanud ja see on t\u00f5eliselt ainulaadne toode, mis suudab seda teha. Hinna k\u00fcsimus on juba teine teema.<\/p>\n<p>Kokkuv\u00f5ttes on minu isiklik arvamus, et meil on endiselt vaja andmehoidlat kui meie aruandluse peamist andmeallikat ning k\u00f5ik, mis sinna ei mahu, salvestame andmej\u00e4rve. Anal\u00fc\u00fctika roll on pakkuda ettev\u00f5ttele mugavat juurdep\u00e4\u00e4su otsuste tegemiseks. \u00dcksk\u00f5ik kuidas v\u00f5tta, t\u00f6\u00f6tavad \u00e4ri kasutajad andmehoidlaga t\u00f5husamalt kui andmej\u00e4rvega; n\u00e4iteks Amazonis on olemas Redshift (anal\u00fc\u00fctiline andmehoidla) ja Redshift Spectrum\/Athena (SQL liides andmej\u00e4rvele S3-s, mis p\u00f5hineb Hive\/Presto). Sama kehtib ka teiste kaasaegsete anal\u00fc\u00fctiliste andmehoidlate kohta.<\/p>\n<p>Vaadakem t\u00fc\u00fcpilist andmehoidla arhitektuuri:<\/p>\n<p><img decoding=\"async\" alt=\"Kas me vajame andmej\u00e4rve? Kuidas andmesalvestusega edasi minna?\" src=\"\/wp-content\/uploads\/2020\/01\/a2015f7f5e28e8a671699682105e011e.png\" style=\"display:block;margin: 0 auto;\" \/><br \/>\n<br \/>\nSee on klassikaline lahendus. Meil on allikate s\u00fcsteemid, mille abil ETL\/ELT kaudu kopeerime andmed anal\u00fc\u00fctilisse andmehoidlasse ja \u00fchendame need Business Intelligence lahendusega (minu lemmik on Tableau, aga mis on teie?). <\/p>\n<p>Sellisel lahendusel on j\u00e4rgmised puudused:<\/p>\n<ul>\n<li>ETL\/ELT operatsioonid n\u00f5uavad aega ja ressursse.<\/li>\n<li>Reeglina ei ole andmete salvestamine anal\u00fc\u00fctilises andmehoidlas odav (n\u00e4iteks Redshift, BigQuery, Teradata), kuna peame ostma terve klastrite komplekti.<\/li>\n<li>\u00c4rikasutajatel on juurdep\u00e4\u00e4s puhastatud ja sageli aggregeeritud andmetele ning neil ei ole v\u00f5imalust saada tooreid andmeid.<\/li>\n<\/ul>\n<p>\nMuidugi s\u00f5ltub k\u00f5ik teie juhtumist. Kui teie andmehoidlas ei ole probleeme, siis ei ole teil andmej\u00e4rve \u00fcldse vaja. Kuid kui tekivad probleemid koha, v\u00f5imekuse v\u00f5i hinna eest, siis on m\u00f5ttekas kaaluda andmej\u00e4rve varianti. Sellep\u00e4rast on andmej\u00e4rv v\u00e4ga populaarne. Siin on n\u00e4ide andmej\u00e4rve arhitektuurist:<br \/>\n<img decoding=\"async\" alt=\"Kas me vajame andmej\u00e4rve? Kuidas andmesalvestusega edasi minna?\" src=\"\/wp-content\/uploads\/2020\/01\/c952e2202a6ce2c8d7d91215aa5390cc.png\" style=\"display:block;margin: 0 auto;\" \/><br \/>\nAndmej\u00e4rve l\u00e4henemisviisi kasutades laadime toored andmed meie andmej\u00e4rve (batch v\u00f5i streaming) ja seej\u00e4rel t\u00f6\u00f6tleme andmeid vastavalt vajadusele. Andmej\u00e4rv v\u00f5imaldab \u00e4ri kasutajatel luua oma andmete transformatsioone (ETL\/ELT) v\u00f5i anal\u00fc\u00fcsida andmeid Business Intelligence lahendustes (kui on vajalik draiver).<\/p>\n<blockquote><p>Iga anal\u00fc\u00fctilise lahenduse eesm\u00e4rk on teenida \u00e4ri kasutajaid. Seet\u00f5ttu peame alati t\u00f6\u00f6tama \u00e4ri n\u00f5udmistest l\u00e4htudes. (Amazonis on see \u00fcks p\u00f5him\u00f5tteid \u2014 t\u00f6\u00f6tama tagurpidi).<\/p><\/blockquote>\n<p> T\u00f6\u00f6tades nii andmehoidla kui andmej\u00e4rvega, saame v\u00f5rrelda m\u00f5lemat lahendust:<\/p>\n<p><img decoding=\"async\" alt=\"Kas me vajame andmej\u00e4rve? Kuidas andmesalvestusega edasi minna?\" src=\"\/wp-content\/uploads\/2020\/01\/07b62ac9838438a0b28caf1b22b2dccd.png\" style=\"display:block;margin: 0 auto;\" \/><br \/>\n<br \/>\nPeamine j\u00e4reldus, mille v\u00f5ib teha, on see, et andmesalvestus ei konkureeri andmej\u00e4rvega, vaid t\u00e4iendab seda. Kuid teil on \u00f5igus otsustada, mis sobib teie juhtumiga. Alati on huvitav ise proovida ja \u00f5iged j\u00e4reldused teha.<\/p>\n<p>Tahan r\u00e4\u00e4kida ka \u00fchest juhtumist, kui hakkasin kasutama andmej\u00e4rve l\u00e4henemist. K\u00f5ik oli \u00fcsna banaalne, proovisin kasutada ELT t\u00f6\u00f6riista (meil oli Matillion ETL) ja Amazon Redshift, minu lahendus toimis, kuid ei vastanud n\u00f5uetele.<\/p>\n<p>Mul oli vaja v\u00f5tta veebilogid, neid transformeerida ja agregeerida, et esitada andmed kahe juhtumi jaoks:<\/p>\n<ol>\n<li>Turundusmeeskond soovis anal\u00fc\u00fcsida botide tegevust SEO jaoks<\/li>\n<li>IT soovis vaadata veebisaitide t\u00f6\u00f6 statistikat<\/li>\n<\/ol>\n<p>\nV\u00e4ga lihtsad, v\u00e4ga lihtsad logid. Siin on n\u00e4ide:<\/p>\n<pre><code class=\"plaintext\">https 2018-07-02T22:23:00.186641Z app\/my-loadbalancer\/50dc6c495c0c9188 \n192.168.131.39:2817 10.0.0.1:80 0.086 0.048 0.037 200 200 0 57 \n\"GET https:\/\/www.example.com:443\/ HTTP\/1.1\" \"curl\/7.46.0\" ECDHE-RSA-AES128-GCM-SHA256 TLSv1.2 \narn:aws:elasticloadbalancing:us-east-2:123456789012:targetgroup\/my-targets\/73e2d6bc24d8a067\n\"Root=1-58337281-1d84f3d73c47ec4e58577259\" \"www.example.com\" \"arn:aws:acm:us-east-2:123456789012:certificate\/12345678-1234-1234-1234-123456789012\"\n1 2018-07-02T22:22:48.364000Z \"authenticate,forward\" \"-\" \"-\"<\/code><\/pre>\n<p>\n\u00dche faili suurus oli 1-4 megabaiti.<\/p>\n<p>Kuid oli \u00fcks raskus. Meil oli 7 domeeni \u00fcle kogu maailma, ja \u00fche p\u00e4eva jooksul loodi 7000 faili. See pole v\u00e4ga suur kogus, kokku 50 gigabaiti. Kuid meie Redshifti klaster oli ka v\u00e4ike (4 s\u00f5lme). Traditsiooniliste meetoditega \u00fche faili laadimine v\u00f5ttis umbes minuti. See t\u00e4hendab, et probleem ei lahendatud otse. See oli see juhtum, kui otsustasin kasutada andmej\u00e4rve l\u00e4henemist. Lahendus n\u00e4gi v\u00e4lja umbes nii:<\/p>\n<p><img decoding=\"async\" alt=\"Kas me vajame andmej\u00e4rve? Kuidas andmesalvestusega edasi minna?\" src=\"\/wp-content\/uploads\/2020\/01\/21ca33e82da56f83b3deab4c32eb2345.png\" style=\"display:block;margin: 0 auto;\" \/><br \/>\n<br \/>\nSee on piisavalt lihtne (tahan t\u00e4hele panna, et pilveteenustes t\u00f6\u00f6tamise eelis on lihtsus). Kasutasin:<\/p>\n<ul>\n<li>AWS Elastic Map Reduce (Hadoop) kui arvutusv\u00f5imsust <\/li>\n<li>AWS S3 kui failihoidla, millel on andmete kr\u00fcpteerimise ja juurdep\u00e4\u00e4su piiramise v\u00f5imalused<\/li>\n<li>Spark kui InMemory arvutusv\u00f5imsus ja PySpark andmete loogika ja transformatsiooni jaoks<\/li>\n<li>Parquet kui Spark'i t\u00f6\u00f6 tulemus<\/li>\n<li>AWS Glue Crawler kui uute andmete ja partiide metaandmete kogum<\/li>\n<li>Redshift Spectrum kui SQL liides andmej\u00e4rvele olemasolevatele Redshift kasutajatele<\/li>\n<\/ul>\n<p>\nK\u00f5ige v\u00e4iksem EMR+Spark klaster t\u00f6\u00f6tles kogu failipaki 30 minutiga. On ka teisi juhtumeid AWS jaoks, eriti palju, mis on seotud Alexaga, kus andmeid on v\u00e4ga palju. <\/p>\n<p>Hiljuti sain teada \u00fche andmej\u00e4rve puuduse \u2014 see on GDPR. Probleem on selles, et kui klient palub andmeid kustutada ja need on \u00fches faili, siis ei saa me kasutada Andmete Manipuleerimise Keelt ning DELETE k\u00e4sku nagu andmebaasis.<\/p>\n<p>Loodan, et artikkel selgitas andmehoidla ja andmej\u00e4rve vahelisi erinevusi. Kui see oli huvitav, siis v\u00f5in t\u00f5lkida veel oma artikleid v\u00f5i professionaalide artikleid, keda loen. Samuti v\u00f5in r\u00e4\u00e4kida lahendustest, millega t\u00f6\u00f6tan, ja nende arhitektuurist.<br \/>\n<br \/>Allikas: <a content=\"nofollow\" rel=\"nofollow\" href=\"https:\/\/habr.com\/ru\/post\/485180\/\">habr.com<\/a><\/p>","protected":false,"gt_translate_keys":[{"key":"rendered","format":"html"}]},"excerpt":{"rendered":"<p>\u042d\u0442\u043e \u0441\u0442\u0430\u0442\u044c\u044f \u043f\u0435\u0440\u0435\u0432\u043e\u0434 \u043c\u043e\u0435\u0439 \u0441\u0442\u0430\u0442\u044c\u0438 \u043d\u0430 medium \u2014 Getting Started with Data Lake, \u043a\u043e\u0442\u043e\u0440\u0430\u044f \u043e\u043a\u0430\u0437\u0430\u043b\u0430\u0441\u044c \u0434\u043e\u0432\u043e\u043b\u044c\u043d\u043e \u043f\u043e\u043f\u0443\u043b\u044f\u0440\u043d\u043e\u0439, \u043d\u0430\u0432\u0435\u0440\u043d\u043e\u0435 \u0438\u0437-\u0437\u0430 \u0441\u0432\u043e\u0435\u0439 \u043f\u0440\u043e\u0441\u0442\u043e\u0442\u044b. \u041f\u043e\u044d\u0442\u043e\u043c\u0443 \u044f \u0440\u0435\u0448\u0438\u043b \u043d\u0430\u043f\u0438\u0441\u0430\u0442\u044c \u0435\u0435 \u043d\u0430 \u0440\u0443\u0441\u0441\u043a\u043e\u043c \u044f\u0437\u044b\u043a\u0435 \u0438 \u043d\u0435\u043c\u043d\u043e\u0433\u043e \u0434\u043e\u043f\u043e\u043b\u043d\u0438\u0442\u044c, \u0447\u0442\u043e\u0431\u044b \u043f\u0440\u043e\u0441\u0442\u043e\u043c\u0443 \u0447\u0435\u043b\u043e\u0432\u0435\u043a\u0443, \u043a\u043e\u0442\u043e\u0440\u044b\u0439 \u043d\u0435 \u044f\u0432\u043b\u044f\u0435\u0442\u0441\u044f \u0441\u043f\u0435\u0446\u0438\u0430\u043b\u0438\u0441\u0442\u043e\u043c \u043f\u043e \u0440\u0430\u0431\u043e\u0442\u0435 \u0441 \u0434\u0430\u043d\u043d\u044b\u043c\u0438 \u0441\u0442\u0430\u043b\u043e \u043f\u043e\u043d\u044f\u0442\u043d\u043e, \u0447\u0442\u043e \u0442\u0430\u043a\u043e\u0435 \u0445\u0440\u0430\u043d\u0438\u043b\u0438\u0449\u0435 \u0434\u0430\u043d\u043d\u044b\u0445 (DW), \u0430 \u0447\u0442\u043e \u0442\u0430\u043a\u043e\u0435 \u043e\u0437\u0435\u0440\u043e \u0434\u0430\u043d\u043d\u044b\u0445 [&hellip;]<\/p>\n","protected":false,"gt_translate_keys":[{"key":"rendered","format":"html"}]},"author":1,"featured_media":0,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[688],"tags":[],"class_list":["post-55701","post","type-post","status-publish","format-standard","hentry","category-administrirovanie"],"aioseo_notices":[],"aioseo_head":"\n\t\t<!-- All in One SEO 5.0.1.1 - aioseo.com -->\n\t<meta name=\"description\" content=\"\u042d\u0442\u043e \u0441\u0442\u0430\u0442\u044c\u044f \u043f\u0435\u0440\u0435\u0432\u043e\u0434 \u043c\u043e\u0435\u0439 \u0441\u0442\u0430\u0442\u044c\u0438 \u043d\u0430 medium \u2014 Getting Started with Data Lake.\" \/>\n\t<meta name=\"robots\" content=\"max-image-preview:large\" \/>\n\t<meta name=\"author\" content=\"Yuri Gagarin\"\/>\n\t<link rel=\"canonical\" href=\"https:\/\/prohoster.info\/et\/blog\/administrirovanie\/nuzhno-li-nam-ozero-dannyh-a-chto-delat-s-hranilishhem-dannyh\" \/>\n\t<meta name=\"generator\" content=\"All in One SEO (AIOSEO) 5.0.1.1\" \/>\n\t\t<meta property=\"og:locale\" content=\"et_EE\" \/>\n\t\t<meta property=\"og:site_name\" content=\"ProHoster | \u041a\u0443\u043f\u0438\u0442\u044c \u043d\u0430\u0434\u0435\u0436\u043d\u044b\u0439 \u0445\u043e\u0441\u0442\u0438\u043d\u0433 \u0434\u043b\u044f \u0441\u0430\u0439\u0442\u043e\u0432 \u0441 \u0437\u0430\u0449\u0438\u0442\u043e\u0439 \u043e\u0442 DDoS, VPS VDS \u0441\u0435\u0440\u0432\u0435\u0440\u044b\" \/>\n\t\t<meta property=\"og:type\" content=\"article\" \/>\n\t\t<meta property=\"og:title\" content=\"\ud83e\udd47\u041d\u0443\u0436\u043d\u043e \u043b\u0438 \u043d\u0430\u043c \u043e\u0437\u0435\u0440\u043e \u0434\u0430\u043d\u043d\u044b\u0445? \u0410 \u0447\u0442\u043e \u0434\u0435\u043b\u0430\u0442\u044c \u0441 \u0445\u0440\u0430\u043d\u0438\u043b\u0438\u0449\u0435\u043c \u0434\u0430\u043d\u043d\u044b\u0445? | ProHoster\" \/>\n\t\t<meta property=\"og:description\" content=\"\u042d\u0442\u043e \u0441\u0442\u0430\u0442\u044c\u044f \u043f\u0435\u0440\u0435\u0432\u043e\u0434 \u043c\u043e\u0435\u0439 \u0441\u0442\u0430\u0442\u044c\u0438 \u043d\u0430 medium \u2014 Getting Started with Data Lake.\" \/>\n\t\t<meta property=\"og:url\" content=\"https:\/\/prohoster.info\/et\/blog\/administrirovanie\/nuzhno-li-nam-ozero-dannyh-a-chto-delat-s-hranilishhem-dannyh\" \/>\n\t\t<meta property=\"og:image\" content=\"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg\" \/>\n\t\t<meta property=\"og:image:secure_url\" content=\"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg\" \/>\n\t\t<meta property=\"og:image:width\" content=\"350\" \/>\n\t\t<meta property=\"og:image:height\" content=\"350\" \/>\n\t\t<meta property=\"article:published_time\" content=\"2020-01-25T21:00:00+00:00\" \/>\n\t\t<meta property=\"article:modified_time\" content=\"2020-02-18T11:03:50+00:00\" \/>\n\t\t<meta property=\"article:publisher\" content=\"https:\/\/www.facebook.com\/prohoster\" \/>\n\t\t<meta property=\"article:author\" content=\"https:\/\/www.facebook.com\/prohoster\" \/>\n\t\t<!-- All in One SEO -->\n\n","aioseo_head_json":{"title":"\ud83e\udd47Kas vajame andmej\u00e4rve? Ent kuidas on lood andmehoidla puhul? | ProHoster","description":"See artikkel on minu Mediumis ilmunud artikli t\u00f5lge \u2014 Andmej\u00e4rvega alustamine.","canonical_url":"https:\/\/prohoster.info\/et\/blog\/administrirovanie\/nuzhno-li-nam-ozero-dannyh-a-chto-delat-s-hranilishhem-dannyh","robots":"max-image-preview:large","keywords":"","webmasterTools":{"miscellaneous":""},"schema":null,"og:locale":"et_EE","og:site_name":"ProHoster | \u041a\u0443\u043f\u0438\u0442\u044c \u043d\u0430\u0434\u0435\u0436\u043d\u044b\u0439 \u0445\u043e\u0441\u0442\u0438\u043d\u0433 \u0434\u043b\u044f \u0441\u0430\u0439\u0442\u043e\u0432 \u0441 \u0437\u0430\u0449\u0438\u0442\u043e\u0439 \u043e\u0442 DDoS, VPS VDS \u0441\u0435\u0440\u0432\u0435\u0440\u044b","og:type":"article","og:title":"\ud83e\udd47\u041d\u0443\u0436\u043d\u043e \u043b\u0438 \u043d\u0430\u043c \u043e\u0437\u0435\u0440\u043e \u0434\u0430\u043d\u043d\u044b\u0445? \u0410 \u0447\u0442\u043e \u0434\u0435\u043b\u0430\u0442\u044c \u0441 \u0445\u0440\u0430\u043d\u0438\u043b\u0438\u0449\u0435\u043c \u0434\u0430\u043d\u043d\u044b\u0445? | ProHoster","og:description":"\u042d\u0442\u043e \u0441\u0442\u0430\u0442\u044c\u044f \u043f\u0435\u0440\u0435\u0432\u043e\u0434 \u043c\u043e\u0435\u0439 \u0441\u0442\u0430\u0442\u044c\u0438 \u043d\u0430 medium \u2014 Getting Started with Data Lake.","og:url":"https:\/\/prohoster.info\/et\/blog\/administrirovanie\/nuzhno-li-nam-ozero-dannyh-a-chto-delat-s-hranilishhem-dannyh","og:image":"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg","og:image:secure_url":"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg","og:image:width":350,"og:image:height":350,"article:published_time":"2020-01-25T21:00:00+00:00","article:modified_time":"2020-02-18T11:03:50+00:00","article:publisher":"https:\/\/www.facebook.com\/prohoster","article:author":"https:\/\/www.facebook.com\/prohoster"},"aioseo_meta_data":{"post_id":"55701","title":null,"description":null,"keywords":null,"keyphrases":null,"primary_term":null,"canonical_url":null,"og_title":null,"og_description":null,"og_object_type":"default","og_image_type":"default","og_image_url":null,"og_image_width":null,"og_image_height":null,"og_image_custom_url":null,"og_image_custom_fields":null,"og_video":null,"og_custom_url":null,"og_article_section":null,"og_article_tags":null,"twitter_use_og":false,"twitter_card":"default","twitter_image_type":"default","twitter_image_url":null,"twitter_image_custom_url":null,"twitter_image_custom_fields":null,"twitter_title":null,"twitter_description":null,"schema":{"blockGraphs":[],"customGraphs":[],"default":{"data":{"Article":[],"Course":[],"Dataset":[],"FAQPage":[],"Movie":[],"Person":[],"Product":[],"ProductReview":[],"Car":[],"Recipe":[],"Service":[],"SoftwareApplication":[],"WebPage":[]},"graphName":"","isEnabled":true},"graphs":[]},"schema_type":null,"schema_type_options":null,"pillar_content":false,"robots_default":true,"robots_noindex":false,"robots_noarchive":false,"robots_nosnippet":false,"robots_nofollow":false,"robots_noimageindex":false,"robots_noodp":false,"robots_notranslate":false,"robots_max_snippet":null,"robots_max_videopreview":null,"robots_max_imagepreview":"large","priority":null,"frequency":null,"local_seo":null,"seo_analyzer_scan_date":null,"breadcrumb_settings":null,"limit_modified_date":false,"reviewed_by":null,"ai":null,"created":"2021-02-28 19:38:32","updated":"2022-09-27 20:27:01","focus_keyword":null,"additional_keywords":null,"truseo_locale":null},"gt_translate_keys":[{"key":"link","format":"url"}],"_links":{"self":[{"href":"https:\/\/prohoster.info\/et\/wp-json\/wp\/v2\/posts\/55701","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/prohoster.info\/et\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/prohoster.info\/et\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/prohoster.info\/et\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/prohoster.info\/et\/wp-json\/wp\/v2\/comments?post=55701"}],"version-history":[{"count":0,"href":"https:\/\/prohoster.info\/et\/wp-json\/wp\/v2\/posts\/55701\/revisions"}],"wp:attachment":[{"href":"https:\/\/prohoster.info\/et\/wp-json\/wp\/v2\/media?parent=55701"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/prohoster.info\/et\/wp-json\/wp\/v2\/categories?post=55701"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/prohoster.info\/et\/wp-json\/wp\/v2\/tags?post=55701"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}