{"id":55701,"date":"2020-01-26T00:00:00","date_gmt":"2020-01-25T21:00:00","guid":{"rendered":"https:\/\/prohoster.info\/blog\/blog_prohoster\/nuzhno-li-nam-ozero-dannyh-a-chto-delat-s-hranilishhem-dannyh"},"modified":"2020-02-18T14:03:50","modified_gmt":"2020-02-18T11:03:50","slug":"nuzhno-li-nam-ozero-dannyh-a-chto-delat-s-hranilishhem-dannyh","status":"publish","type":"post","link":"https:\/\/prohoster.info\/pl\/blog\/administrirovanie\/nuzhno-li-nam-ozero-dannyh-a-chto-delat-s-hranilishhem-dannyh","title":{"rendered":"Czy potrzebujemy jeziora danych? A co z magazynem danych?","gt_translate_keys":[{"key":"rendered","format":"text"}]},"content":{"rendered":"<p>To jest artyku\u0142 b\u0119d\u0105cy t\u0142umaczeniem mojego tekstu na medium \u2014 <noindex><a rel=\"nofollow\" href=\"https:\/\/medium.com\/rock-your-data\/getting-started-with-data-lake-4bb13643f9\">Wprowadzenie do Data Lake<\/a><\/noindex>, kt\u00f3ry okaza\u0142 si\u0119 do\u015b\u0107 popularny, prawdopodobnie z powodu swojej prostoty. Dlatego postanowi\u0142em napisa\u0107 go w j\u0119zyku polskim i troch\u0119 rozbudowa\u0107, aby przeci\u0119tny cz\u0142owiek, kt\u00f3ry nie jest specjalist\u0105 od danych, zrozumia\u0142, czym jest hurtownia danych (DW), a czym jest jezioro danych (Data Lake) i jak obie te koncepcje wsp\u00f3\u0142\u017cyj\u0105. <\/p>\n<p>Dlaczego chcia\u0142em napisa\u0107 o jeziorze danych? Pracuj\u0119 z danymi i analityk\u0105 od ponad 10 lat, a obecnie pracuj\u0119 z wielkimi danymi w Amazon Alexa AI w Cambridge, kt\u00f3re znajduj\u0105 si\u0119 w Bostonie, chocia\u017c sam mieszkam na wyspie Vancouver w Victorii i cz\u0119sto bywaj\u0105 w Bostonie, Seattle oraz Vancouver, a czasem nawet w Moskwie na konferencjach. Czasami pisz\u0119, ale g\u0142\u00f3wnie po angielsku, napisa\u0142em ju\u017c <noindex><a rel=\"nofollow\" href=\"https:\/\/www.amazon.com\/Dmitry-Anoshin\/e\/B01A5PVT2M\">kilka ksi\u0105\u017cek<\/a><\/noindex>, mam te\u017c potrzeb\u0119 dzielenia si\u0119 trendami analitycznymi z Ameryki P\u00f3\u0142nocnej i czasami pisz\u0119 w <noindex><a rel=\"nofollow\" href=\"https:\/\/t.me\/rockyourdata\">Telegramie<\/a><\/noindex>.<\/p>\n<p>Zawsze pracowa\u0142em z hurtowniami danych, a od 2015 roku intensywnie pracuj\u0119 z Amazon Web Services, a w og\u00f3le przeszed\u0142em na chmur\u0119 analityczn\u0105 (AWS, Azure, GCP). Obserwowa\u0142em ewolucj\u0119 rozwi\u0105za\u0144 analitycznych od 2007 roku, a nawet pracowa\u0142em w firmie dostarczaj\u0105cej hurtownie danych Teradata, wdra\u017caj\u0105c je w Sberbanku, wtedy wszyscy zacz\u0119li m\u00f3wi\u0107, \u017ce era hurtowni si\u0119 sko\u0144czy\u0142a i teraz wszyscy s\u0105 na Hadoopie, a potem zacz\u0119li m\u00f3wi\u0107 o jeziorze danych, \u017ce to ju\u017c na pewno koniec hurtowni danych. Ale na szcz\u0119\u015bcie (mo\u017ce dla niekt\u00f3rych nieszcz\u0119\u015bcie, kt\u00f3rzy zarabiali du\u017co na konfigurowaniu Hadoop), hurtownie danych nie znikn\u0119\u0142y. <br \/>\n<noindex><a rel=\"nofollow\" name=\"habracut\"><\/a><\/noindex><br \/>\nW tym artykule przyjrzymy si\u0119, czym jest jezioro danych. Artyku\u0142 jest skierowany do os\u00f3b, kt\u00f3re maj\u0105 ma\u0142e do\u015bwiadczenie z hurtowniami danych lub w og\u00f3le go nie maj\u0105.<\/p>\n<p><img decoding=\"async\" alt=\"Czy potrzebujemy jeziora danych? A co z magazynem danych?\" src=\"\/wp-content\/uploads\/2020\/01\/85b3eda809ce19fc33efb2fad4e93a41.png\" style=\"display:block;margin: 0 auto;\" \/><br \/>\n<br \/>\nNa zdj\u0119ciu jezioro Bled, to jedno z moich ulubionych jezior, chocia\u017c by\u0142em tam tylko raz, ale zapami\u0119ta\u0142em je na ca\u0142e \u017cycie. Ale porozmawiajmy o innym rodzaju jeziora \u2014 jeziorze danych. By\u0107 mo\u017ce wielu z Was ju\u017c nieraz s\u0142ysza\u0142o ten termin, ale dodatkowa definicja nie zaszkodzi.<\/p>\n<p>Przede wszystkim oto najpopularniejsze definicje Jeziora Danych:<\/p>\n<blockquote><p>\"pliki przechowuj\u0105ce wszystkie rodzaje surowych danych, kt\u00f3re s\u0105 dost\u0119pne do analizy przez kogokolwiek w organizacji\" \u2014 Martin Fowler.<\/p><\/blockquote>\n<blockquote><p>\u201eJe\u015bli my\u015blisz, \u017ce jezioro danych to butelka wody \u2014 oczyszczonej, zapakowanej i roz\u0142o\u017conej do wygodnego u\u017cycia, to jezioro danych to ogromny zbiornik wody w jej naturalnej formie. U\u017cytkownicy mog\u0105 nabiera\u0107 wod\u0119 dla siebie, nurkowa\u0107 w g\u0142\u0105b, bada\u0107\u201d \u2014 James Dickson. <\/p><\/blockquote>\n<p> Teraz na pewno wiemy, \u017ce jezioro danych to kwestia analityki, pozwala nam przechowywa\u0107 du\u017ce ilo\u015bci danych w ich pierwotnej formie i mamy do nich niezb\u0119dny oraz wygodny dost\u0119p.<\/p>\n<p>Cz\u0119sto lubi\u0119 upraszcza\u0107 rzeczy; je\u015bli mog\u0119 wyja\u015bni\u0107 skomplikowany termin prostymi s\u0142owami, to znaczy, \u017ce zrozumia\u0142em, jak to dzia\u0142a i po co to jest potrzebne. Kiedy\u015b grzeba\u0142em w iPhonie w galerii zdj\u0119\u0107, i nasun\u0119\u0142o mi si\u0119, \u017ce to w\u0142a\u015bnie prawdziwe jezioro danych. Zrobi\u0142em nawet slajd na konferencje:<\/p>\n<p><img decoding=\"async\" alt=\"Czy potrzebujemy jeziora danych? A co z magazynem danych?\" src=\"\/wp-content\/uploads\/2020\/01\/1956ddf4091ca00f6d86c33a6780d495.png\" style=\"display:block;margin: 0 auto;\" \/><br \/>\n<br \/>\nTo bardzo proste. Robimy zdj\u0119cie telefonem, zdj\u0119cie zapisuje si\u0119 w telefonie i mo\u017ce by\u0107 przechowywane w iCloud (przechowalnia plik\u00f3w w chmurze). Telefon zbiera r\u00f3wnie\u017c metadane zdj\u0119cia: co jest przedstawione, geotag, czas. W rezultacie mo\u017cemy korzysta\u0107 z wygodnego interfejsu iPhone'a, aby znale\u017a\u0107 nasze zdj\u0119cie i przy tym widzimy nawet dane, na przyk\u0142ad, gdy szukam zdj\u0119\u0107 s\u0142owem ogie\u0144 (fire), znajduj\u0119 3 zdj\u0119cia przedstawiaj\u0105ce ognisko. Dla mnie to jak narz\u0119dzie Business Intelligence, kt\u00f3re dzia\u0142a bardzo szybko i precyzyjnie. <\/p>\n<p>I oczywi\u015bcie nie mo\u017cemy zapomina\u0107 o bezpiecze\u0144stwie (autoryzacji i uwierzytelnianiu), w przeciwnym razie nasze dane mog\u0105 \u0142atwo trafi\u0107 do publicznego dost\u0119pu. Jest wiele wiadomo\u015bci o du\u017cych firmach i startupach, kt\u00f3rych dane trafi\u0142y do publicznego dost\u0119pu z powodu niedbalstwa programist\u00f3w i nieprzestrzegania prostych zasad.<\/p>\n<p>Nawet taki prosty obrazek pomaga nam wyobrazi\u0107 sobie, czym jest jezioro danych, jego r\u00f3\u017cnice w por\u00f3wnaniu do tradycyjnego magazynu danych oraz jego g\u0142\u00f3wne elementy:<\/p>\n<ol>\n<li><b>\u0141adowanie danych <\/b>(Ingestion) \u2014 kluczowy sk\u0142adnik jeziora danych. Dane mog\u0105 trafia\u0107 do magazynu danymi na dwa sposoby \u2014 batch (\u0142adowanie w interwa\u0142ach) oraz streaming (strumie\u0144 danych).<\/li>\n<li><b>Magazyn plik\u00f3w<\/b> (Storage) \u2014 g\u0142\u00f3wny sk\u0142adnik Jeziora Danych. Musimy mie\u0107 zapewnione, \u017ce magazyn jest \u0142atwo skalowalny, niezwykle niezawodny i ma niskie koszty. Na przyk\u0142ad w AWS to S3.<\/li>\n<li><b>Katalog i Wyszukiwanie<\/b> (Katalog i Wyszukiwanie) \u2014 aby unikn\u0105\u0107 Bagna Danych (kiedy wszystkie dane s\u0105 wrzucane w jedno miejsce, co p\u00f3\u017aniej uniemo\u017cliwia ich przetwarzanie), musimy stworzy\u0107 warstw\u0119 metadanych do klasyfikacji danych, aby u\u017cytkownicy mogli \u0142atwo znale\u017a\u0107 potrzebne informacje do analizy. Dodatkowo mo\u017cna zastosowa\u0107 inne rozwi\u0105zania do wyszukiwania, na przyk\u0142ad ElasticSearch. Wyszukiwanie umo\u017cliwia u\u017cytkownikowi odnalezienie potrzebnych danych za pomoc\u0105 przyjaznych interfejs\u00f3w.<\/li>\n<li><b>Przetwarzanie<\/b> (Proces) \u2014 ten krok odpowiada za przetwarzanie i transformacj\u0119 danych. Mo\u017cemy przekszta\u0142ca\u0107 dane, zmienia\u0107 ich struktury, oczyszcza\u0107 je i wiele wi\u0119cej. <\/li>\n<li><b>Bezpiecze\u0144stwo<\/b> (Bezpiecze\u0144stwo) \u2014 wa\u017cne jest, aby po\u015bwi\u0119ci\u0107 czas na projektowanie bezpiecze\u0144stwa rozwi\u0105zania. Na przyk\u0142ad szyfrowanie danych podczas przechowywania, przetwarzania i \u0142adowania. Kluczowe jest stosowanie metod autoryzacji i uwierzytelniania. Podsumowuj\u0105c, potrzebne s\u0105 narz\u0119dzia do audytu.<\/li>\n<\/ol>\n<p>\nZ praktycznego punktu widzenia mo\u017cemy scharakteryzowa\u0107 jezioro danych trzema atrybutami:<\/p>\n<ol>\n<li><b>Zbieraj i przechowuj cokolwiek<\/b> \u2014 jezioro danych zawiera wszystkie dane, zar\u00f3wno surowe, nieprzetworzone dane z dowolnego okresu, jak i przetworzone \/ oczyszczone dane.<\/li>\n<li><b>G\u0142\u0119boka analiza<\/b> \u2014 jezioro danych umo\u017cliwia u\u017cytkownikom badanie i analizowanie danych.<\/li>\n<li><b>Elastyczny dost\u0119p<\/b> \u2014 jezioro danych zapewnia elastyczny dost\u0119p do r\u00f3\u017cnych danych i r\u00f3\u017cnych scenariuszy.<\/li>\n<\/ol>\n<p>\nTeraz mo\u017cna porozmawia\u0107 o r\u00f3\u017cnicy mi\u0119dzy magazynem danych a jeziorem danych. Zazwyczaj ludzie pytaj\u0105:<\/p>\n<ul>\n<li>A co z magazynem danych?<\/li>\n<li>Czy zast\u0119pujemy magazyn danych jeziorem danych, czy go rozszerzamy?<\/li>\n<li>Czy mo\u017cna jednak obej\u015b\u0107 si\u0119 bez jeziora danych?<\/li>\n<\/ul>\n<p>\nKr\u00f3tko m\u00f3wi\u0105c, nie ma jednoznacznej odpowiedzi. Wszystko zale\u017cy od konkretnej sytuacji, umiej\u0119tno\u015bci w zespole i bud\u017cetu. Na przyk\u0142ad migracja magazynu danych z Oracle do AWS i stworzenie jeziora danych przez sp\u00f3\u0142k\u0119 c\u00f3rk\u0119 Amazona \u2014 Woot \u2014 <noindex><a rel=\"nofollow\" href=\"https:\/\/aws.amazon.com\/blogs\/big-data\/our-data-lake-story-how-woot-com-built-a-serverless-data-lake-on-aws\/\">Nasza historia jeziora danych: Jak Woot.com zbudowa\u0142o bezserwerowe jezioro danych na AWS<\/a><\/noindex>. <\/p>\n<p>Z drugiej strony, dostawca Snowflake twierdzi, \u017ce nie musisz ju\u017c my\u015ble\u0107 o jeziorze danych, poniewa\u017c ich platforma danych (do 2020 roku by\u0142o to magazyn danych) pozwala na po\u0142\u0105czenie jeziora danych z magazynem danych. Pracowa\u0142em nieco ze Snowflake i to naprawd\u0119 unikalny produkt, kt\u00f3ry to potrafi. Cena to inna kwestia.<\/p>\n<p>Podsumowuj\u0105c, moim osobistym zdaniem, nadal potrzebujemy hurtowni danych jako g\u0142\u00f3wnego \u017ar\u00f3d\u0142a danych do naszych raport\u00f3w, a wszystko, co si\u0119 nie zmie\u015bci, przechowujemy w jeziorze danych. G\u0142\u00f3wna rola analityki to zapewnienie biznesowi wygodnego dost\u0119pu do podejmowania decyzji. Biznesowi u\u017cytkownicy pracuj\u0105 efektywniej z hurtowni\u0105 danych ni\u017c z jeziorem danych; na przyk\u0142ad, w Amazonie s\u0105 Redshift (hurtownia danych analitycznych) oraz Redshift Spectrum\/Athena (interfejs SQL do jeziora danych w S3 oparty na Hive\/Presto). To samo dotyczy innych nowoczesnych hurtowni danych analitycznych.<\/p>\n<p>Przyjrzyjmy si\u0119 typowej architekturze hurtowni danych:<\/p>\n<p><img decoding=\"async\" alt=\"Czy potrzebujemy jeziora danych? A co z magazynem danych?\" src=\"\/wp-content\/uploads\/2020\/01\/a2015f7f5e28e8a671699682105e011e.png\" style=\"display:block;margin: 0 auto;\" \/><br \/>\n<br \/>\nTo klasyczne rozwi\u0105zanie. Mamy systemy \u017ar\u00f3d\u0142owe, a za pomoc\u0105 ETL\/ELT kopiujemy dane do hurtowni danych analitycznych i \u0142\u0105czymy je z rozwi\u0105zaniem Business Intelligence (moje ulubione to Tableau, a jakie jest twoje?). <\/p>\n<p>Takie rozwi\u0105zanie ma nast\u0119puj\u0105ce wady:<\/p>\n<ul>\n<li>Operacje ETL\/ELT wymagaj\u0105 czasu i zasob\u00f3w.<\/li>\n<li>Zazwyczaj pami\u0119\u0107 do przechowywania danych w hurtowni danych analitycznych nie jest tania (na przyk\u0142ad Redshift, BigQuery, Teradata), poniewa\u017c musimy kupi\u0107 ca\u0142y klaster.<\/li>\n<li>Biznesowi u\u017cytkownicy maj\u0105 dost\u0119p do oczyszczonych i cz\u0119sto agregowanych danych i nie maj\u0105 mo\u017cliwo\u015bci uzyskania surowych danych.<\/li>\n<\/ul>\n<p>\nOczywi\u015bcie, wszystko zale\u017cy od twojego przypadku. Je\u015bli nie masz problem\u00f3w ze swoj\u0105 hurtowni\u0105 danych, to zupe\u0142nie nie potrzebujesz jeziora danych. Ale gdy pojawiaj\u0105 si\u0119 problemy z brakiem miejsca, mocy lub cena ma kluczowe znaczenie, warto rozwa\u017cy\u0107 opcj\u0119 jeziora danych. Dlatego jezioro danych jest bardzo popularne. Oto przyk\u0142ad architektury jeziora danych:<br \/>\n<img decoding=\"async\" alt=\"Czy potrzebujemy jeziora danych? A co z magazynem danych?\" src=\"\/wp-content\/uploads\/2020\/01\/c952e2202a6ce2c8d7d91215aa5390cc.png\" style=\"display:block;margin: 0 auto;\" \/><br \/>\nStosuj\u0105c podej\u015bcie jeziora danych, \u0142adujemy surowe dane do naszego jeziora danych (wsadowo lub strumieniowo), a nast\u0119pnie przetwarzamy dane w razie potrzeby. Jezioro danych pozwala biznesowym u\u017cytkownikom tworzy\u0107 w\u0142asne transformacje danych (ETL\/ELT) lub analizowa\u0107 dane w rozwi\u0105zaniach Business Intelligence (je\u015bli jest odpowiedni sterownik).<\/p>\n<blockquote><p>Celem ka\u017cdego rozwi\u0105zania analitycznego jest s\u0142u\u017cenie u\u017cytkownikom biznesowym. Dlatego zawsze musimy dzia\u0142a\u0107 zgodnie z wymaganiami biznesu. (W Amazonie to jedna z zasad \u2014 working backwards).<\/p><\/blockquote>\n<p> Pracuj\u0105c zar\u00f3wno z hurtowni\u0105 danych, jak i z jeziorem danych, mo\u017cemy por\u00f3wna\u0107 oba rozwi\u0105zania:<\/p>\n<p><img decoding=\"async\" alt=\"Czy potrzebujemy jeziora danych? A co z magazynem danych?\" src=\"\/wp-content\/uploads\/2020\/01\/07b62ac9838438a0b28caf1b22b2dccd.png\" style=\"display:block;margin: 0 auto;\" \/><br \/>\n<br \/>\nG\u0142\u00f3wny wniosek, kt\u00f3ry mo\u017cna wysun\u0105\u0107, to \u017ce hurtownia danych wcale nie konkuruje z jeziorem danych, a raczej je uzupe\u0142nia. To zawsze wy zale\u017cy, co jest odpowiednie dla waszego przypadku. Zawsze warto spr\u00f3bowa\u0107 samodzielnie i wyci\u0105gn\u0105\u0107 w\u0142a\u015bciwe wnioski.<\/p>\n<p>Chcia\u0142bym r\u00f3wnie\u017c opowiedzie\u0107 o jednym przypadku, w kt\u00f3rym zacz\u0105\u0142em u\u017cywa\u0107 podej\u015bcia jeziora danych. Wszystko jest do\u015b\u0107 banalne; pr\u00f3bowa\u0142em u\u017cy\u0107 narz\u0119dzia ELT (mieli\u015bmy Matillion ETL) oraz Amazon Redshift, moje rozwi\u0105zanie dzia\u0142a\u0142o, ale nie spe\u0142nia\u0142o wszystkich wymog\u00f3w.<\/p>\n<p>Musia\u0142em wzi\u0105\u0107 logi z sieci, przekszta\u0142ci\u0107 je i zgrupowa\u0107, aby dostarczy\u0107 dane dla dw\u00f3ch przypadk\u00f3w:<\/p>\n<ol>\n<li>Zesp\u00f3\u0142 marketingowy chcia\u0142 analizowa\u0107 aktywno\u015b\u0107 bot\u00f3w pod k\u0105tem SEO<\/li>\n<li>IT chcia\u0142o ogl\u0105da\u0107 metryki dotycz\u0105ce dzia\u0142ania stron internetowych<\/li>\n<\/ol>\n<p>\nBardzo proste, bardzo proste logi. Oto przyk\u0142ad:<\/p>\n<pre><code class=\"plaintext\">https 2018-07-02T22:23:00.186641Z app\/my-loadbalancer\/50dc6c495c0c9188 \n192.168.131.39:2817 10.0.0.1:80 0.086 0.048 0.037 200 200 0 57 \n\"GET https:\/\/www.example.com:443\/ HTTP\/1.1\" \"curl\/7.46.0\" ECDHE-RSA-AES128-GCM-SHA256 TLSv1.2 \narn:aws:elasticloadbalancing:us-east-2:123456789012:targetgroup\/my-targets\/73e2d6bc24d8a067\n\"Root=1-58337281-1d84f3d73c47ec4e58577259\" \"www.example.com\" \"arn:aws:acm:us-east-2:123456789012:certificate\/12345678-1234-1234-1234-123456789012\"\n1 2018-07-02T22:22:48.364000Z \"authenticate,forward\" \"-\" \"-\"<\/code><\/pre>\n<p>\nJeden plik wa\u017cy\u0142 od 1 do 4 megabajt\u00f3w.<\/p>\n<p>Ale napotka\u0142em jeden problem. Mieli\u015bmy 7 domen na ca\u0142ym \u015bwiecie, a w ci\u0105gu jednego dnia tworzono 7000 plik\u00f3w. To nie by\u0142 ogromny wolumen, zaledwie 50 gigabajt\u00f3w. Ale rozmiar naszego klastra Redshift by\u0142 r\u00f3wnie\u017c niewielki (4 w\u0119z\u0142y). \u0141adowanie jednego pliku tradycyjn\u0105 metod\u0105 zajmowa\u0142o oko\u0142o minuty. To znaczy, zadanie nie mog\u0142o by\u0107 rozwi\u0105zane w trybie od razu. I to by\u0142 ten przypadek, w kt\u00f3rym zdecydowa\u0142em si\u0119 na podej\u015bcie jeziora danych. Rozwi\u0105zanie wygl\u0105da\u0142o mniej wi\u0119cej tak:<\/p>\n<p><img decoding=\"async\" alt=\"Czy potrzebujemy jeziora danych? A co z magazynem danych?\" src=\"\/wp-content\/uploads\/2020\/01\/21ca33e82da56f83b3deab4c32eb2345.png\" style=\"display:block;margin: 0 auto;\" \/><br \/>\n<br \/>\nJest do\u015b\u0107 proste (chc\u0119 zaznaczy\u0107, \u017ce zalet\u0105 pracy w chmurze jest prostota). U\u017cy\u0142em:<\/p>\n<ul>\n<li>AWS Elastic Map Reduce (Hadoop) jako moc obliczeniowa <\/li>\n<li>AWS S3 jako magazyn plik\u00f3w z mo\u017cliwo\u015bci\u0105 szyfrowania danych i ograniczania dost\u0119pu<\/li>\n<li>Spark jako moc obliczeniowa InMemory oraz PySpark do logiki i transformacji danych<\/li>\n<li>Parquet jako wynik pracy Sparka<\/li>\n<li>AWS Glue Crawler jako zbieracz metadanych o nowych danych i partycjach<\/li>\n<li>Redshift Spectrum jako interfejs SQL do jeziora danych dla istniej\u0105cych u\u017cytkownik\u00f3w Redshift<\/li>\n<\/ul>\n<p>\nNajmniejszy klaster EMR+Spark przetwarza\u0142 ca\u0142\u0105 parti\u0119 plik\u00f3w w 30 minut. Istniej\u0105 r\u00f3wnie\u017c inne przypadki dla AWS, szczeg\u00f3lnie wiele zwi\u0105zanych z Alex\u0105, gdzie danych jest bardzo du\u017co. <\/p>\n<p>Ostatnio dowiedzia\u0142em si\u0119 o jednym z wad jeziora danych \u2014 to RODO. Problem polega na tym, \u017ce gdy klient prosi o ich usuni\u0119cie, a dane znajduj\u0105 si\u0119 w jednym z plik\u00f3w, nie mo\u017cemy u\u017cy\u0107 j\u0119zyka manipulacji danymi i operacji DELETE jak w bazie danych.<\/p>\n<p>Mam nadziej\u0119, \u017ce artyku\u0142 wyja\u015bni\u0142 r\u00f3\u017cnic\u0119 mi\u0119dzy magazynem danych a jeziorem danych. Je\u015bli by\u0142o ciekawie, mog\u0119 przet\u0142umaczy\u0107 jeszcze moje artyku\u0142y lub artyku\u0142y profesjonalist\u00f3w, kt\u00f3rych czytam. Mog\u0119 r\u00f3wnie\u017c opowiedzie\u0107 o rozwi\u0105zaniach, z kt\u00f3rymi pracuj\u0119, oraz ich architekturze.<br \/>\n<br \/>\u0179r\u00f3d\u0142o: <a content=\"nofollow\" rel=\"nofollow\" href=\"https:\/\/habr.com\/ru\/post\/485180\/\">habr.com<\/a><\/p>","protected":false,"gt_translate_keys":[{"key":"rendered","format":"html"}]},"excerpt":{"rendered":"<p>\u042d\u0442\u043e \u0441\u0442\u0430\u0442\u044c\u044f \u043f\u0435\u0440\u0435\u0432\u043e\u0434 \u043c\u043e\u0435\u0439 \u0441\u0442\u0430\u0442\u044c\u0438 \u043d\u0430 medium \u2014 Getting Started with Data Lake, \u043a\u043e\u0442\u043e\u0440\u0430\u044f \u043e\u043a\u0430\u0437\u0430\u043b\u0430\u0441\u044c \u0434\u043e\u0432\u043e\u043b\u044c\u043d\u043e \u043f\u043e\u043f\u0443\u043b\u044f\u0440\u043d\u043e\u0439, \u043d\u0430\u0432\u0435\u0440\u043d\u043e\u0435 \u0438\u0437-\u0437\u0430 \u0441\u0432\u043e\u0435\u0439 \u043f\u0440\u043e\u0441\u0442\u043e\u0442\u044b. \u041f\u043e\u044d\u0442\u043e\u043c\u0443 \u044f \u0440\u0435\u0448\u0438\u043b \u043d\u0430\u043f\u0438\u0441\u0430\u0442\u044c \u0435\u0435 \u043d\u0430 \u0440\u0443\u0441\u0441\u043a\u043e\u043c \u044f\u0437\u044b\u043a\u0435 \u0438 \u043d\u0435\u043c\u043d\u043e\u0433\u043e \u0434\u043e\u043f\u043e\u043b\u043d\u0438\u0442\u044c, \u0447\u0442\u043e\u0431\u044b \u043f\u0440\u043e\u0441\u0442\u043e\u043c\u0443 \u0447\u0435\u043b\u043e\u0432\u0435\u043a\u0443, \u043a\u043e\u0442\u043e\u0440\u044b\u0439 \u043d\u0435 \u044f\u0432\u043b\u044f\u0435\u0442\u0441\u044f \u0441\u043f\u0435\u0446\u0438\u0430\u043b\u0438\u0441\u0442\u043e\u043c \u043f\u043e \u0440\u0430\u0431\u043e\u0442\u0435 \u0441 \u0434\u0430\u043d\u043d\u044b\u043c\u0438 \u0441\u0442\u0430\u043b\u043e \u043f\u043e\u043d\u044f\u0442\u043d\u043e, \u0447\u0442\u043e \u0442\u0430\u043a\u043e\u0435 \u0445\u0440\u0430\u043d\u0438\u043b\u0438\u0449\u0435 \u0434\u0430\u043d\u043d\u044b\u0445 (DW), \u0430 \u0447\u0442\u043e \u0442\u0430\u043a\u043e\u0435 \u043e\u0437\u0435\u0440\u043e \u0434\u0430\u043d\u043d\u044b\u0445 [&hellip;]<\/p>\n","protected":false,"gt_translate_keys":[{"key":"rendered","format":"html"}]},"author":1,"featured_media":0,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[688],"tags":[],"class_list":["post-55701","post","type-post","status-publish","format-standard","hentry","category-administrirovanie"],"aioseo_notices":[],"aioseo_head":"\n\t\t<!-- All in One SEO 5.0.1.1 - aioseo.com -->\n\t<meta name=\"description\" content=\"\u042d\u0442\u043e \u0441\u0442\u0430\u0442\u044c\u044f \u043f\u0435\u0440\u0435\u0432\u043e\u0434 \u043c\u043e\u0435\u0439 \u0441\u0442\u0430\u0442\u044c\u0438 \u043d\u0430 medium \u2014 Getting Started with Data Lake.\" \/>\n\t<meta name=\"robots\" content=\"max-image-preview:large\" \/>\n\t<meta name=\"author\" content=\"Yuri Gagarin\"\/>\n\t<link rel=\"canonical\" href=\"https:\/\/prohoster.info\/pl\/blog\/administrirovanie\/nuzhno-li-nam-ozero-dannyh-a-chto-delat-s-hranilishhem-dannyh\" \/>\n\t<meta name=\"generator\" content=\"All in One SEO (AIOSEO) 5.0.1.1\" \/>\n\t\t<meta property=\"og:locale\" content=\"pl_PL\" \/>\n\t\t<meta property=\"og:site_name\" content=\"ProHoster | \u041a\u0443\u043f\u0438\u0442\u044c \u043d\u0430\u0434\u0435\u0436\u043d\u044b\u0439 \u0445\u043e\u0441\u0442\u0438\u043d\u0433 \u0434\u043b\u044f \u0441\u0430\u0439\u0442\u043e\u0432 \u0441 \u0437\u0430\u0449\u0438\u0442\u043e\u0439 \u043e\u0442 DDoS, VPS VDS \u0441\u0435\u0440\u0432\u0435\u0440\u044b\" \/>\n\t\t<meta property=\"og:type\" content=\"article\" \/>\n\t\t<meta property=\"og:title\" content=\"\ud83e\udd47\u041d\u0443\u0436\u043d\u043e \u043b\u0438 \u043d\u0430\u043c \u043e\u0437\u0435\u0440\u043e \u0434\u0430\u043d\u043d\u044b\u0445? \u0410 \u0447\u0442\u043e \u0434\u0435\u043b\u0430\u0442\u044c \u0441 \u0445\u0440\u0430\u043d\u0438\u043b\u0438\u0449\u0435\u043c \u0434\u0430\u043d\u043d\u044b\u0445? | ProHoster\" \/>\n\t\t<meta property=\"og:description\" content=\"\u042d\u0442\u043e \u0441\u0442\u0430\u0442\u044c\u044f \u043f\u0435\u0440\u0435\u0432\u043e\u0434 \u043c\u043e\u0435\u0439 \u0441\u0442\u0430\u0442\u044c\u0438 \u043d\u0430 medium \u2014 Getting Started with Data Lake.\" \/>\n\t\t<meta property=\"og:url\" content=\"https:\/\/prohoster.info\/pl\/blog\/administrirovanie\/nuzhno-li-nam-ozero-dannyh-a-chto-delat-s-hranilishhem-dannyh\" \/>\n\t\t<meta property=\"og:image\" content=\"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg\" \/>\n\t\t<meta property=\"og:image:secure_url\" content=\"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg\" \/>\n\t\t<meta property=\"og:image:width\" content=\"350\" \/>\n\t\t<meta property=\"og:image:height\" content=\"350\" \/>\n\t\t<meta property=\"article:published_time\" content=\"2020-01-25T21:00:00+00:00\" \/>\n\t\t<meta property=\"article:modified_time\" content=\"2020-02-18T11:03:50+00:00\" \/>\n\t\t<meta property=\"article:publisher\" content=\"https:\/\/www.facebook.com\/prohoster\" \/>\n\t\t<meta property=\"article:author\" content=\"https:\/\/www.facebook.com\/prohoster\" \/>\n\t\t<!-- All in One SEO -->\n\n","aioseo_head_json":{"title":"\ud83e\udd47Czy potrzebujemy jeziora danych? A co zrobi\u0107 z magazynem danych? | ProHoster","description":"To artyku\u0142 t\u0142umacz\u0105cy m\u00f3j tekst na medium \u2014 Jak zacz\u0105\u0107 z jeziorem danych.","canonical_url":"https:\/\/prohoster.info\/pl\/blog\/administrirovanie\/nuzhno-li-nam-ozero-dannyh-a-chto-delat-s-hranilishhem-dannyh","robots":"max-image-preview:large","keywords":"","webmasterTools":{"miscellaneous":""},"schema":null,"og:locale":"pl_PL","og:site_name":"ProHoster | \u041a\u0443\u043f\u0438\u0442\u044c \u043d\u0430\u0434\u0435\u0436\u043d\u044b\u0439 \u0445\u043e\u0441\u0442\u0438\u043d\u0433 \u0434\u043b\u044f \u0441\u0430\u0439\u0442\u043e\u0432 \u0441 \u0437\u0430\u0449\u0438\u0442\u043e\u0439 \u043e\u0442 DDoS, VPS VDS \u0441\u0435\u0440\u0432\u0435\u0440\u044b","og:type":"article","og:title":"\ud83e\udd47\u041d\u0443\u0436\u043d\u043e \u043b\u0438 \u043d\u0430\u043c \u043e\u0437\u0435\u0440\u043e \u0434\u0430\u043d\u043d\u044b\u0445? \u0410 \u0447\u0442\u043e \u0434\u0435\u043b\u0430\u0442\u044c \u0441 \u0445\u0440\u0430\u043d\u0438\u043b\u0438\u0449\u0435\u043c \u0434\u0430\u043d\u043d\u044b\u0445? | ProHoster","og:description":"\u042d\u0442\u043e \u0441\u0442\u0430\u0442\u044c\u044f \u043f\u0435\u0440\u0435\u0432\u043e\u0434 \u043c\u043e\u0435\u0439 \u0441\u0442\u0430\u0442\u044c\u0438 \u043d\u0430 medium \u2014 Getting Started with Data Lake.","og:url":"https:\/\/prohoster.info\/pl\/blog\/administrirovanie\/nuzhno-li-nam-ozero-dannyh-a-chto-delat-s-hranilishhem-dannyh","og:image":"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg","og:image:secure_url":"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg","og:image:width":350,"og:image:height":350,"article:published_time":"2020-01-25T21:00:00+00:00","article:modified_time":"2020-02-18T11:03:50+00:00","article:publisher":"https:\/\/www.facebook.com\/prohoster","article:author":"https:\/\/www.facebook.com\/prohoster"},"aioseo_meta_data":{"post_id":"55701","title":null,"description":null,"keywords":null,"keyphrases":null,"primary_term":null,"canonical_url":null,"og_title":null,"og_description":null,"og_object_type":"default","og_image_type":"default","og_image_url":null,"og_image_width":null,"og_image_height":null,"og_image_custom_url":null,"og_image_custom_fields":null,"og_video":null,"og_custom_url":null,"og_article_section":null,"og_article_tags":null,"twitter_use_og":false,"twitter_card":"default","twitter_image_type":"default","twitter_image_url":null,"twitter_image_custom_url":null,"twitter_image_custom_fields":null,"twitter_title":null,"twitter_description":null,"schema":{"blockGraphs":[],"customGraphs":[],"default":{"data":{"Article":[],"Course":[],"Dataset":[],"FAQPage":[],"Movie":[],"Person":[],"Product":[],"ProductReview":[],"Car":[],"Recipe":[],"Service":[],"SoftwareApplication":[],"WebPage":[]},"graphName":"","isEnabled":true},"graphs":[]},"schema_type":null,"schema_type_options":null,"pillar_content":false,"robots_default":true,"robots_noindex":false,"robots_noarchive":false,"robots_nosnippet":false,"robots_nofollow":false,"robots_noimageindex":false,"robots_noodp":false,"robots_notranslate":false,"robots_max_snippet":null,"robots_max_videopreview":null,"robots_max_imagepreview":"large","priority":null,"frequency":null,"local_seo":null,"seo_analyzer_scan_date":null,"breadcrumb_settings":null,"limit_modified_date":false,"reviewed_by":null,"ai":null,"created":"2021-02-28 19:38:32","updated":"2022-09-27 20:27:01","focus_keyword":null,"additional_keywords":null,"truseo_locale":null},"gt_translate_keys":[{"key":"link","format":"url"}],"_links":{"self":[{"href":"https:\/\/prohoster.info\/pl\/wp-json\/wp\/v2\/posts\/55701","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/prohoster.info\/pl\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/prohoster.info\/pl\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/prohoster.info\/pl\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/prohoster.info\/pl\/wp-json\/wp\/v2\/comments?post=55701"}],"version-history":[{"count":0,"href":"https:\/\/prohoster.info\/pl\/wp-json\/wp\/v2\/posts\/55701\/revisions"}],"wp:attachment":[{"href":"https:\/\/prohoster.info\/pl\/wp-json\/wp\/v2\/media?parent=55701"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/prohoster.info\/pl\/wp-json\/wp\/v2\/categories?post=55701"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/prohoster.info\/pl\/wp-json\/wp\/v2\/tags?post=55701"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}