{"id":55701,"date":"2020-01-26T00:00:00","date_gmt":"2020-01-25T21:00:00","guid":{"rendered":"https:\/\/prohoster.info\/blog\/blog_prohoster\/nuzhno-li-nam-ozero-dannyh-a-chto-delat-s-hranilishhem-dannyh"},"modified":"2020-02-18T14:03:50","modified_gmt":"2020-02-18T11:03:50","slug":"nuzhno-li-nam-ozero-dannyh-a-chto-delat-s-hranilishhem-dannyh","status":"publish","type":"post","link":"https:\/\/prohoster.info\/de\/blog\/administrirovanie\/nuzhno-li-nam-ozero-dannyh-a-chto-delat-s-hranilishhem-dannyh","title":{"rendered":"Brauchen wir einen Datensee? Und was ist mit dem Datenspeicher?","gt_translate_keys":[{"key":"rendered","format":"text"}]},"content":{"rendered":"<p>Dieser Artikel ist eine \u00dcbersetzung meines Artikels auf Medium \u2014 <noindex><a rel=\"nofollow\" href=\"https:\/\/medium.com\/rock-your-data\/getting-started-with-data-lake-4bb13643f9\">Einstieg in Data Lake<\/a><\/noindex>, der sich als ziemlich beliebt herausgestellt hat, wahrscheinlich wegen seiner Einfachheit. Daher habe ich beschlossen, ihn auf Deutsch zu schreiben und ein wenig zu erg\u00e4nzen, damit es auch einer Person, die kein Datenexperte ist, klar wird, was ein Data Warehouse (DW) und was ein Data Lake ist, und wie sie zusammen funktionieren. <\/p>\n<p>Warum wollte ich \u00fcber den Data Lake schreiben? Ich arbeite seit mehr als 10 Jahren mit Daten und Analytik, und im Moment arbeite ich definitiv mit gro\u00dfen Daten bei Amazon Alexa AI in Cambridge, das in Boston liegt, obwohl ich selbst in Victoria auf Vancouver Island wohne und oft sowohl in Boston als auch in Seattle und Vancouver bin, und manchmal sogar in Moskau auf Konferenzen spreche. Auch schreibe ich von Zeit zu Zeit, haupts\u00e4chlich auf Englisch, und habe bereits <noindex><a rel=\"nofollow\" href=\"https:\/\/www.amazon.com\/Dmitry-Anoshin\/e\/B01A5PVT2M\">einige B\u00fccher<\/a><\/noindex>, au\u00dferdem habe ich das Bed\u00fcrfnis, Trends der Analytik aus Nordamerika zu teilen, und ich schreibe manchmal in <noindex><a rel=\"nofollow\" href=\"https:\/\/t.me\/rockyourdata\">Telegram<\/a><\/noindex>.<\/p>\n<p>Ich habe immer mit Datenspeichern gearbeitet und seit 2015 intensiv mit Amazon Web Services, also allgemein mit Cloud-Analytik (AWS, Azure, GCP). Ich habe die Entwicklung von Analyse-L\u00f6sungen seit 2007 beobachtet und habe sogar bei dem Datenspeicher-Anbieter Teradata gearbeitet, wo ich dessen L\u00f6sung bei Sberbank implementiert habe. In dieser Zeit entstand Big Data mit Hadoop. Alle begannen zu sagen, dass die \u00c4ra der Datenspeicher vorbei sei und jetzt alles Hadoop sei, und bald sprach man \u00fcber Data Lakes, erneut mit der Behauptung, dass es f\u00fcr Datenspeicher nun endg\u00fcltig vorbei sei. Aber zum Gl\u00fcck (vielleicht f\u00fcr einige ungl\u00fccklich, die viel Geld mit der Einrichtung von Hadoop verdient haben) ist das Datenschlie\u00dffach nicht verschwunden. <br \/>\n<noindex><a rel=\"nofollow\" name=\"habracut\"><\/a><\/noindex><br \/>\nIn diesem Artikel werden wir uns mit dem Thema Data Lake besch\u00e4ftigen. Der Artikel richtet sich an Personen, die wenig oder gar keine Erfahrung mit Datenspeichern haben.<\/p>\n<p><img decoding=\"async\" alt=\"Brauchen wir einen Datensee? Und was ist mit dem Datenspeicher?\" src=\"\/wp-content\/uploads\/2020\/01\/85b3eda809ce19fc33efb2fad4e93a41.png\" style=\"display:block;margin: 0 auto;\" \/><br \/>\n<br \/>\nAuf dem Bild ist der Bleder See zu sehen, eines meiner Lieblingsseen, auch wenn ich nur einmal dort war, aber ich habe ihn mein Leben lang in Erinnerung behalten. Aber wir sprechen \u00fcber einen anderen Typ von See \u2014 das Data Lake. Vielleicht haben viele von Ihnen diesen Begriff schon oft geh\u00f6rt, aber eine weitere Definition kann nie schaden.<\/p>\n<p>Zun\u00e4chst sind hier die bekanntesten Definitionen eines Data Lakes:<\/p>\n<blockquote><p>\u201eEin Dateispeicher f\u00fcr alle Arten von Rohdaten, die von jedem in der Organisation analysiert werden k\u00f6nnen\u201c \u2014 Martin Fowler.<\/p><\/blockquote>\n<blockquote><p>\u201eWenn Sie denken, dass ein Data Warehouse eine Flasche Wasser ist \u2014 gereinigt, verpackt und f\u00fcr den bequemen Gebrauch abgef\u00fcllt, dann ist ein Data Lake ein riesiger Reservoir mit Wasser in seiner nat\u00fcrlichen Form. Benutzer k\u00f6nnen sich Wasser sch\u00f6pfen, tauchen und erforschen\u201c \u2014 James Dixon. <\/p><\/blockquote>\n<p> Jetzt wissen wir ganz genau, dass ein Data Lake sich um Analytik dreht, er erm\u00f6glicht es uns, gro\u00dfe Datenmengen in ihrer urspr\u00fcnglichen Form zu speichern, und wir haben den n\u00f6tigen und bequemen Zugriff auf die Daten.<\/p>\n<p>Ich liebe es oft, Dinge zu vereinfachen. Wenn ich einen komplexen Begriff in einfachen Worten erkl\u00e4ren kann, habe ich f\u00fcr mich selbst verstanden, wie es funktioniert und wof\u00fcr es gebraucht wird. So war ich einmal mit meinem iPhone in der Fotogalerie besch\u00e4ftigt, und es kam mir in den Sinn, dass das tats\u00e4chlich ein Data Lake ist; ich habe sogar eine Folie f\u00fcr Konferenzen erstellt:<\/p>\n<p><img decoding=\"async\" alt=\"Brauchen wir einen Datensee? Und was ist mit dem Datenspeicher?\" src=\"\/wp-content\/uploads\/2020\/01\/1956ddf4091ca00f6d86c33a6780d495.png\" style=\"display:block;margin: 0 auto;\" \/><br \/>\n<br \/>\nEs ist ganz einfach. Wir machen ein Foto mit dem Handy, das Foto wird auf dem Handy gespeichert und kann in iCloud (Cloud-Speicher) gespeichert werden. Au\u00dferdem sammelt das Handy Metadaten des Fotos: was darauf abgebildet ist, Geotags, Zeit. Das Ergebnis ist, dass wir die benutzerfreundliche iPhone-Oberfl\u00e4che nutzen k\u00f6nnen, um unser Foto zu finden, und dabei sehen wir sogar Auswertungen. Wenn ich zum Beispiel nach Bildern mit dem Wort Feuer suche, finde ich drei Fotos mit dem Bild eines Lagerfeuers. F\u00fcr mich ist das wie ein Business-Intelligence-Tool, das sehr schnell und pr\u00e4zise arbeitet. <\/p>\n<p>Und nat\u00fcrlich d\u00fcrfen wir die Sicherheit (Autorisierung und Authentifizierung) nicht vergessen, sonst k\u00f6nnen unsere Daten leicht in die falschen H\u00e4nde geraten. Es gibt viele Nachrichten \u00fcber gro\u00dfe Unternehmen und Startups, deren Daten wegen Nachl\u00e4ssigkeit der Entwickler und der Missachtung einfacher Regeln in den offenen Zugang gelangt sind.<\/p>\n<p>Selbst so ein einfaches Bild hilft uns zu verstehen, was ein Datenlake ist, wie er sich von einem traditionellen Datenspeicher unterscheidet und welche Hauptelemente er hat:<\/p>\n<ol>\n<li><b>Daten hochladen <\/b>(Ingestion) \u2014 ein zentraler Bestandteil des Data Lakes. Daten k\u00f6nnen auf zwei Arten in das Datenspeicher gelangen: durch Batch-Verarbeitung (\u00dcbertragung in Intervallen) und Streaming (Datenstrom).<\/li>\n<li><b>Dateispeicher<\/b> (Storage) \u2014 die Hauptkomponente des Data Lakes. Es ist wichtig, dass der Speicher skalierbar, \u00e4u\u00dferst zuverl\u00e4ssig und kosteneffizient ist. Zum Beispiel ist das S3 in AWS.<\/li>\n<li><b>Katalog und Suche<\/b> (Catalog and Search) \u2014 um das Data Swamp zu vermeiden (was passiert, wenn wir alle Daten in einem Haufen ablegen und dann nicht mehr damit arbeiten k\u00f6nnen), m\u00fcssen wir eine Metadatenebene schaffen, um die Daten zu klassifizieren, damit Benutzer die Daten, die sie f\u00fcr ihre Analysen ben\u00f6tigen, leicht finden k\u00f6nnen. Zus\u00e4tzlich k\u00f6nnen weitere Suchl\u00f6sungen wie ElasticSearch eingesetzt werden. Die Suche hilft dem Benutzer, die ben\u00f6tigten Daten \u00fcber eine benutzerfreundliche Schnittstelle zu finden.<\/li>\n<li><b>Verarbeitung<\/b> (Process) \u2014 dieser Schritt ist f\u00fcr die Verarbeitung und Transformation der Daten verantwortlich. Wir k\u00f6nnen Daten transformieren, ihre Strukturen \u00e4ndern, sie bereinigen und vieles mehr. <\/li>\n<li><b>Sicherheit<\/b> (Sicherheit) \u2014 es ist wichtig, Zeit f\u00fcr das Design der Sicherheitsl\u00f6sung aufzuwenden. Zum Beispiel die Verschl\u00fcsselung von Daten w\u00e4hrend der Speicherung, Verarbeitung und \u00dcbertragung. Authentifizierungs- und Autorisierungsmethoden sollten verwendet werden. Abschlie\u00dfend wird ein Audit-Tool ben\u00f6tigt.<\/li>\n<\/ol>\n<p>\nAus praktischer Sicht k\u00f6nnen wir einen Datensee durch drei Attribute charakterisieren:<\/p>\n<ol>\n<li><b>Sammeln und speichern Sie alles, was Sie m\u00f6chten<\/b> \u2014 ein Datensee enth\u00e4lt alle Daten, sowohl rohe, unverarbeitete Daten \u00fcber einen beliebigen Zeitraum als auch verarbeitete\/bereinigte Daten.<\/li>\n<li><b>Tiefenanalyse<\/b> \u2014 ein Datensee erm\u00f6glicht es Benutzern, Daten zu erkunden und zu analysieren.<\/li>\n<li><b>Flexibler Zugang<\/b> \u2014 ein Datensee bietet flexiblen Zugang zu verschiedenen Daten und Szenarien.<\/li>\n<\/ol>\n<p>\nNun k\u00f6nnen wir \u00fcber den Unterschied zwischen einem Data Warehouse und einem Datensee sprechen. Normalerweise fragen die Leute:<\/p>\n<ul>\n<li>Und was ist mit dem Data Warehouse?<\/li>\n<li>Ersetzen wir das Data Warehouse durch einen Datensee oder erweitern wir es?<\/li>\n<li>Kann man tats\u00e4chlich auf einen Datensee verzichten?<\/li>\n<\/ul>\n<p>\nKurz gesagt, es gibt keine klare Antwort. Es h\u00e4ngt von der konkreten Situation, den F\u00e4higkeiten im Team und dem Budget ab. Zum Beispiel die Migration eines Datenlagers auf Oracle in AWS und die Schaffung eines Data Lakes durch die Tochtergesellschaft von Amazon \u2013 Woot \u2013 <noindex><a rel=\"nofollow\" href=\"https:\/\/aws.amazon.com\/blogs\/big-data\/our-data-lake-story-how-woot-com-built-a-serverless-data-lake-on-aws\/\">Unsere Data Lake-Geschichte: Wie Woot.com einen serverlosen Data Lake auf AWS aufgebaut hat<\/a><\/noindex>. <\/p>\n<p>Auf der anderen Seite behauptet der Anbieter Snowflake, dass Sie nicht mehr \u00fcber Data Lakes nachdenken m\u00fcssen, da ihre Datenplattform (bis 2020 war es ein Data Warehouse) es Ihnen erm\u00f6glicht, Data Lakes und Data Warehouses zu kombinieren. Ich habe ein wenig mit Snowflake gearbeitet, und es ist wirklich ein einzigartiges Produkt, das dies leisten kann. Die Frage der Kosten ist ein anderes Thema.<\/p>\n<p>Abschlie\u00dfend denke ich, dass wir weiterhin ein Data Warehouse als prim\u00e4re Datenquelle f\u00fcr unsere Berichterstattung ben\u00f6tigen. Alles, was nicht hineinpasst, speichern wir im Data Lake. Die gesamte Rolle der Analytik besteht darin, dem Unternehmen einen einfachen Zugang zur Entscheidungsfindung zu erm\u00f6glichen. Gesch\u00e4ftsanwender arbeiten effizienter mit einem Data Warehouse als mit einem Data Lake. Zum Beispiel gibt es bei Amazon Redshift (das analytische Data Warehouse) und Redshift Spectrum\/Athena (SQL-Schnittstelle f\u00fcr den Data Lake in S3 basierend auf Hive\/Presto). Das gilt auch f\u00fcr andere moderne analytische Data Warehouses.<\/p>\n<p>Betrachten wir die typische Architektur eines Data Warehouses:<\/p>\n<p><img decoding=\"async\" alt=\"Brauchen wir einen Datensee? Und was ist mit dem Datenspeicher?\" src=\"\/wp-content\/uploads\/2020\/01\/a2015f7f5e28e8a671699682105e011e.png\" style=\"display:block;margin: 0 auto;\" \/><br \/>\n<br \/>\nDies ist eine klassische L\u00f6sung. Wir haben Quellsysteme, und mithilfe von ETL\/ELT kopieren wir die Daten in das analytische Data Warehouse und verbinden es mit einer Business Intelligence-L\u00f6sung (mein Favorit ist Tableau, und Ihrer?). <\/p>\n<p>Eine solche L\u00f6sung hat folgende Nachteile:<\/p>\n<ul>\n<li>ETL\/ELT-Operationen ben\u00f6tigen Zeit und Ressourcen.<\/li>\n<li>In der Regel sind die Speicherkosten f\u00fcr Daten in analytischen Data Warehouses nicht g\u00fcnstig (z. B. Redshift, BigQuery, Teradata), da wir einen ganzen Cluster kaufen m\u00fcssen.<\/li>\n<li>Business-Nutzer haben Zugang zu bereinigten und h\u00e4ufig aggregierten Daten und haben keine M\u00f6glichkeit, Rohdaten zu erhalten.<\/li>\n<\/ul>\n<p>\nNat\u00fcrlich h\u00e4ngt alles von Ihrem Anwendungsfall ab. Wenn Sie keine Probleme mit Ihrem Datenspeicher haben, ben\u00f6tigen Sie \u00fcberhaupt kein Data Lake. Aber wenn Probleme mit dem Platz, der Leistung oder den Kosten auftreten, k\u00f6nnte ein Data Lake in Betracht gezogen werden. Genau deshalb ist das Data Lake so beliebt. Hier ist ein Beispiel f\u00fcr die Architektur eines Data Lake:<br \/>\n<img decoding=\"async\" alt=\"Brauchen wir einen Datensee? Und was ist mit dem Datenspeicher?\" src=\"\/wp-content\/uploads\/2020\/01\/c952e2202a6ce2c8d7d91215aa5390cc.png\" style=\"display:block;margin: 0 auto;\" \/><br \/>\nBei der Verwendung des Data-Lake-Ansatzes laden wir Rohdaten in unseren Data Lake (batch oder streaming) und verarbeiten die Daten bei Bedarf. Ein Data Lake erm\u00f6glicht es Business-Nutzern, ihre eigenen Datenumwandlungen (ETL\/ELT) zu erstellen oder Daten in Business-Intelligence-L\u00f6sungen zu analysieren (sofern der erforderliche Treiber vorhanden ist).<\/p>\n<blockquote><p>Ziel jeder Analysel\u00f6sung ist es, den Business-Nutzern zu dienen. Deshalb m\u00fcssen wir immer von den Anforderungen des Unternehmens ausgehen. (Bei Amazon ist dies eines der Prinzipien \u2014 'working backwards').<\/p><\/blockquote>\n<p> Durch die Arbeit sowohl mit dem Datenspeicher als auch mit dem Data Lake k\u00f6nnen wir beide L\u00f6sungen vergleichen:<\/p>\n<p><img decoding=\"async\" alt=\"Brauchen wir einen Datensee? Und was ist mit dem Datenspeicher?\" src=\"\/wp-content\/uploads\/2020\/01\/07b62ac9838438a0b28caf1b22b2dccd.png\" style=\"display:block;margin: 0 auto;\" \/><br \/>\n<br \/>\nDie wichtigste Erkenntnis ist, dass ein Datenspeicher nicht mit einem Data Lake konkurriert, sondern ihn eher erg\u00e4nzt. Letztlich liegt es an Ihnen zu entscheiden, was f\u00fcr Ihren Fall geeignet ist. Es ist immer interessant, es selbst auszuprobieren und die richtigen Schl\u00fcsse zu ziehen.<\/p>\n<p>Ich m\u00f6chte auch einen der F\u00e4lle vorstellen, in dem ich den Data-Lake-Ansatz verwendet habe. Es war alles recht banal, ich habe versucht, ein ELT-Tool (wir hatten Matillion ETL) und Amazon Redshift zu verwenden. Meine L\u00f6sung funktionierte, entsprach aber nicht den Anforderungen.<\/p>\n<p>Ich musste Web-Logs erfassen, transformieren und aggregieren, um Daten f\u00fcr zwei F\u00e4lle bereitzustellen:<\/p>\n<ol>\n<li>Das Marketing-Team wollte die Aktivit\u00e4t von Bots f\u00fcr SEO analysieren.<\/li>\n<li>Die IT wollte die Metriken zur Leistung der Websites \u00fcberwachen.<\/li>\n<\/ol>\n<p>\nGanz einfache, sehr einfache Logs. Hier ist ein Beispiel:<\/p>\n<pre><code class=\"plaintext\">https 2018-07-02T22:23:00.186641Z app\/my-loadbalancer\/50dc6c495c0c9188 \n192.168.131.39:2817 10.0.0.1:80 0.086 0.048 0.037 200 200 0 57 \n&quot;GET https:\/\/www.example.com:443\/ HTTP\/1.1&quot; &quot;curl\/7.46.0&quot; ECDHE-RSA-AES128-GCM-SHA256 TLSv1.2 \narn:aws:elasticloadbalancing:us-east-2:123456789012:targetgroup\/my-targets\/73e2d6bc24d8a067\n&quot;Root=1-58337281-1d84f3d73c47ec4e58577259&quot; &quot;www.example.com&quot; &quot;arn:aws:acm:us-east-2:123456789012:certificate\/12345678-1234-1234-1234-123456789012&quot;\n1 2018-07-02T22:22:48.364000Z &quot;authenticate,forward&quot; &quot;-&quot; &quot;-&quot;<\/code><\/pre>\n<p>\nEine Datei wog 1-4 Megabyte.<\/p>\n<p>Es gab jedoch ein Problem. Wir hatten 7 Domains weltweit, und an einem Tag wurden 7000 Dateien erstellt. Das ist nicht besonders viel, insgesamt 50 Gigabyte. Aber auch die Gr\u00f6\u00dfe unseres Redshift-Clusters war klein (4 Knoten). Das herk\u00f6mmliche Hochladen einer Datei dauerte etwa eine Minute. Das bedeutete, dass die Herausforderung nicht direkt l\u00f6sbar war. Daher entschied ich mich f\u00fcr den Ansatz des Data Lakes. Die L\u00f6sung sah ungef\u00e4hr so aus:<\/p>\n<p><img decoding=\"async\" alt=\"Brauchen wir einen Datensee? Und was ist mit dem Datenspeicher?\" src=\"\/wp-content\/uploads\/2020\/01\/21ca33e82da56f83b3deab4c32eb2345.png\" style=\"display:block;margin: 0 auto;\" \/><br \/>\n<br \/>\nSie ist ziemlich einfach (ich m\u00f6chte darauf hinweisen, dass der Vorteil der Arbeit in der Cloud die Einfachheit ist). Ich habe genutzt:<\/p>\n<ul>\n<li>AWS Elastic Map Reduce (Hadoop) als Rechenleistung <\/li>\n<li>AWS S3 als Dateispeicher mit Datenverschl\u00fcsselung und Zugriffskontrolle<\/li>\n<li>Spark als In-Memory Rechenleistung und PySpark f\u00fcr Logik und Datenumwandlung<\/li>\n<li>Parquet als Ergebnis der Spark-Arbeit<\/li>\n<li>AWS Glue Crawler als Metadatensammler f\u00fcr neue Daten und Partitionen<\/li>\n<li>Redshift Spectrum als SQL-Schnittstelle zum Data Lake f\u00fcr bestehende Redshift-Nutzer<\/li>\n<\/ul>\n<p>\nDer kleinste EMR+Spark-Cluster verarbeitete alle Dateigruppen in 30 Minuten. Es gibt auch andere Anwendungsf\u00e4lle f\u00fcr AWS, insbesondere zahlreiche mit Alexa, wo es sehr viele Daten gibt. <\/p>\n<p>Vor kurzem habe ich einen der Nachteile eines Data Lakes entdeckt \u2013 die DSGVO. Das Problem ist, dass wir, wenn ein Kunde verlangt, dass seine Daten gel\u00f6scht werden, die Data Manipulation Language und die DELETE-Operation nicht wie in einer Datenbank verwenden k\u00f6nnen, da die Daten in einer Datei gespeichert sind.<\/p>\n<p>Ich hoffe, der Artikel hat den Unterschied zwischen einem Data Warehouse und einem Data Lake klargestellt. Wenn es Ihnen gefallen hat, kann ich gerne weitere Artikel von mir oder von professionellen Autoren, die ich lese, \u00fcbersetzen. Ich kann auch \u00fcber die L\u00f6sungen sprechen, mit denen ich arbeite, und deren Architektur.<br \/>\n<br \/>Quelle: <a content=\"nofollow\" rel=\"nofollow\" href=\"https:\/\/habr.com\/ru\/post\/485180\/\">habr.com<\/a><\/p>","protected":false,"gt_translate_keys":[{"key":"rendered","format":"html"}]},"excerpt":{"rendered":"<p>\u042d\u0442\u043e \u0441\u0442\u0430\u0442\u044c\u044f \u043f\u0435\u0440\u0435\u0432\u043e\u0434 \u043c\u043e\u0435\u0439 \u0441\u0442\u0430\u0442\u044c\u0438 \u043d\u0430 medium \u2014 Getting Started with Data Lake, \u043a\u043e\u0442\u043e\u0440\u0430\u044f \u043e\u043a\u0430\u0437\u0430\u043b\u0430\u0441\u044c \u0434\u043e\u0432\u043e\u043b\u044c\u043d\u043e \u043f\u043e\u043f\u0443\u043b\u044f\u0440\u043d\u043e\u0439, \u043d\u0430\u0432\u0435\u0440\u043d\u043e\u0435 \u0438\u0437-\u0437\u0430 \u0441\u0432\u043e\u0435\u0439 \u043f\u0440\u043e\u0441\u0442\u043e\u0442\u044b. \u041f\u043e\u044d\u0442\u043e\u043c\u0443 \u044f \u0440\u0435\u0448\u0438\u043b \u043d\u0430\u043f\u0438\u0441\u0430\u0442\u044c \u0435\u0435 \u043d\u0430 \u0440\u0443\u0441\u0441\u043a\u043e\u043c \u044f\u0437\u044b\u043a\u0435 \u0438 \u043d\u0435\u043c\u043d\u043e\u0433\u043e \u0434\u043e\u043f\u043e\u043b\u043d\u0438\u0442\u044c, \u0447\u0442\u043e\u0431\u044b \u043f\u0440\u043e\u0441\u0442\u043e\u043c\u0443 \u0447\u0435\u043b\u043e\u0432\u0435\u043a\u0443, \u043a\u043e\u0442\u043e\u0440\u044b\u0439 \u043d\u0435 \u044f\u0432\u043b\u044f\u0435\u0442\u0441\u044f \u0441\u043f\u0435\u0446\u0438\u0430\u043b\u0438\u0441\u0442\u043e\u043c \u043f\u043e \u0440\u0430\u0431\u043e\u0442\u0435 \u0441 \u0434\u0430\u043d\u043d\u044b\u043c\u0438 \u0441\u0442\u0430\u043b\u043e \u043f\u043e\u043d\u044f\u0442\u043d\u043e, \u0447\u0442\u043e \u0442\u0430\u043a\u043e\u0435 \u0445\u0440\u0430\u043d\u0438\u043b\u0438\u0449\u0435 \u0434\u0430\u043d\u043d\u044b\u0445 (DW), \u0430 \u0447\u0442\u043e \u0442\u0430\u043a\u043e\u0435 \u043e\u0437\u0435\u0440\u043e \u0434\u0430\u043d\u043d\u044b\u0445 [&hellip;]<\/p>\n","protected":false,"gt_translate_keys":[{"key":"rendered","format":"html"}]},"author":1,"featured_media":0,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[688],"tags":[],"class_list":["post-55701","post","type-post","status-publish","format-standard","hentry","category-administrirovanie"],"aioseo_notices":[],"aioseo_head":"\n\t\t<!-- All in One SEO 4.9.10 - aioseo.com -->\n\t<meta name=\"description\" content=\"\u042d\u0442\u043e \u0441\u0442\u0430\u0442\u044c\u044f \u043f\u0435\u0440\u0435\u0432\u043e\u0434 \u043c\u043e\u0435\u0439 \u0441\u0442\u0430\u0442\u044c\u0438 \u043d\u0430 medium \u2014 Getting Started with Data Lake, \u043a\u043e\u0442\u043e\u0440\u0430\u044f \u043e\u043a\u0430\u0437\u0430\u043b\u0430\u0441\u044c \u0434\u043e\u0432\u043e\u043b\u044c\u043d\u043e \u043f\u043e\u043f\u0443\u043b\u044f\u0440\u043d\u043e\u0439, \u043d\u0430\u0432\u0435\u0440\u043d\u043e\u0435 \u0438\u0437-\u0437\u0430 \u0441\u0432\u043e\u0435\u0439 \u043f\u0440\u043e\u0441\u0442\u043e\u0442\u044b. \u041f\u043e\u044d\u0442\u043e\u043c\u0443 \u044f \u0440\u0435\u0448\u0438\u043b \u043d\u0430\u043f\u0438\u0441\u0430\u0442\u044c \u0435\u0435 \u043d\u0430 \u0440\u0443\u0441\u0441\u043a\u043e\u043c \u044f\u0437\u044b\u043a\u0435 \u0438 \u043d\u0435\u043c\u043d\u043e\u0433\u043e \u0434\u043e\u043f\u043e\u043b\u043d\u0438\u0442\u044c, \u0447\u0442\u043e\u0431\u044b \u043f\u0440\u043e\u0441\u0442\u043e\u043c\u0443 \u0447\u0435\u043b\u043e\u0432\u0435\u043a\u0443, \u043a\u043e\u0442\u043e\u0440\u044b\u0439 \u043d\u0435 \u044f\u0432\u043b\u044f\u0435\u0442\u0441\u044f \u0441\u043f\u0435\u0446\u0438\u0430\u043b\u0438\u0441\u0442\u043e\u043c \u043f\u043e \u0440\u0430\u0431\u043e\u0442\u0435 \u0441 \u0434\u0430\u043d\u043d\u044b\u043c\u0438 \u0441\u0442\u0430\u043b\u043e \u043f\u043e\u043d\u044f\u0442\u043d\u043e, \u0447\u0442\u043e \u0442\u0430\u043a\u043e\u0435 \u0445\u0440\u0430\u043d\u0438\u043b\u0438\u0449\u0435 \u0434\u0430\u043d\u043d\u044b\u0445 (DW), \u0430 \u0447\u0442\u043e \u0442\u0430\u043a\u043e\u0435 \u043e\u0437\u0435\u0440\u043e \u0434\u0430\u043d\u043d\u044b\u0445\" \/>\n\t<meta name=\"robots\" content=\"max-image-preview:large\" \/>\n\t<meta name=\"author\" content=\"Yuri Gagarin\"\/>\n\t<link rel=\"canonical\" href=\"https:\/\/prohoster.info\/de\/blog\/administrirovanie\/nuzhno-li-nam-ozero-dannyh-a-chto-delat-s-hranilishhem-dannyh\" \/>\n\t<meta name=\"generator\" content=\"All in One SEO (AIOSEO) 4.9.10\" \/>\n\t\t<meta property=\"og:locale\" content=\"de_DE\" \/>\n\t\t<meta property=\"og:site_name\" content=\"ProHoster | \u041a\u0443\u043f\u0438\u0442\u044c \u043d\u0430\u0434\u0435\u0436\u043d\u044b\u0439 \u0445\u043e\u0441\u0442\u0438\u043d\u0433 \u0434\u043b\u044f \u0441\u0430\u0439\u0442\u043e\u0432 \u0441 \u0437\u0430\u0449\u0438\u0442\u043e\u0439 \u043e\u0442 DDoS, VPS VDS \u0441\u0435\u0440\u0432\u0435\u0440\u044b\" \/>\n\t\t<meta property=\"og:type\" content=\"article\" \/>\n\t\t<meta property=\"og:title\" content=\"\ud83e\udd47\u041d\u0443\u0436\u043d\u043e \u043b\u0438 \u043d\u0430\u043c \u043e\u0437\u0435\u0440\u043e \u0434\u0430\u043d\u043d\u044b\u0445? \u0410 \u0447\u0442\u043e \u0434\u0435\u043b\u0430\u0442\u044c \u0441 \u0445\u0440\u0430\u043d\u0438\u043b\u0438\u0449\u0435\u043c \u0434\u0430\u043d\u043d\u044b\u0445? | ProHoster\" \/>\n\t\t<meta property=\"og:description\" content=\"\u042d\u0442\u043e \u0441\u0442\u0430\u0442\u044c\u044f \u043f\u0435\u0440\u0435\u0432\u043e\u0434 \u043c\u043e\u0435\u0439 \u0441\u0442\u0430\u0442\u044c\u0438 \u043d\u0430 medium \u2014 Getting Started with Data Lake, \u043a\u043e\u0442\u043e\u0440\u0430\u044f \u043e\u043a\u0430\u0437\u0430\u043b\u0430\u0441\u044c \u0434\u043e\u0432\u043e\u043b\u044c\u043d\u043e \u043f\u043e\u043f\u0443\u043b\u044f\u0440\u043d\u043e\u0439, \u043d\u0430\u0432\u0435\u0440\u043d\u043e\u0435 \u0438\u0437-\u0437\u0430 \u0441\u0432\u043e\u0435\u0439 \u043f\u0440\u043e\u0441\u0442\u043e\u0442\u044b. \u041f\u043e\u044d\u0442\u043e\u043c\u0443 \u044f \u0440\u0435\u0448\u0438\u043b \u043d\u0430\u043f\u0438\u0441\u0430\u0442\u044c \u0435\u0435 \u043d\u0430 \u0440\u0443\u0441\u0441\u043a\u043e\u043c \u044f\u0437\u044b\u043a\u0435 \u0438 \u043d\u0435\u043c\u043d\u043e\u0433\u043e \u0434\u043e\u043f\u043e\u043b\u043d\u0438\u0442\u044c, \u0447\u0442\u043e\u0431\u044b \u043f\u0440\u043e\u0441\u0442\u043e\u043c\u0443 \u0447\u0435\u043b\u043e\u0432\u0435\u043a\u0443, \u043a\u043e\u0442\u043e\u0440\u044b\u0439 \u043d\u0435 \u044f\u0432\u043b\u044f\u0435\u0442\u0441\u044f \u0441\u043f\u0435\u0446\u0438\u0430\u043b\u0438\u0441\u0442\u043e\u043c \u043f\u043e \u0440\u0430\u0431\u043e\u0442\u0435 \u0441 \u0434\u0430\u043d\u043d\u044b\u043c\u0438 \u0441\u0442\u0430\u043b\u043e \u043f\u043e\u043d\u044f\u0442\u043d\u043e, \u0447\u0442\u043e \u0442\u0430\u043a\u043e\u0435 \u0445\u0440\u0430\u043d\u0438\u043b\u0438\u0449\u0435 \u0434\u0430\u043d\u043d\u044b\u0445 (DW), \u0430 \u0447\u0442\u043e \u0442\u0430\u043a\u043e\u0435 \u043e\u0437\u0435\u0440\u043e \u0434\u0430\u043d\u043d\u044b\u0445\" \/>\n\t\t<meta property=\"og:url\" content=\"https:\/\/prohoster.info\/de\/blog\/administrirovanie\/nuzhno-li-nam-ozero-dannyh-a-chto-delat-s-hranilishhem-dannyh\" \/>\n\t\t<meta property=\"og:image\" content=\"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg\" \/>\n\t\t<meta property=\"og:image:secure_url\" content=\"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg\" \/>\n\t\t<meta property=\"og:image:width\" content=\"350\" \/>\n\t\t<meta property=\"og:image:height\" content=\"350\" \/>\n\t\t<meta property=\"article:published_time\" content=\"2020-01-25T21:00:00+00:00\" \/>\n\t\t<meta property=\"article:modified_time\" content=\"2020-02-18T11:03:50+00:00\" \/>\n\t\t<meta property=\"article:publisher\" content=\"https:\/\/www.facebook.com\/prohoster\" \/>\n\t\t<meta property=\"article:author\" content=\"https:\/\/www.facebook.com\/prohoster\" \/>\n\t\t<!-- All in One SEO -->\n\n","aioseo_head_json":{"title":"\ud83e\udd47Brauchen wir einen Data Lake? Und was ist mit dem Data Warehouse? | ProHoster","description":"Dieser Artikel ist eine \u00dcbersetzung meines Aufsatzes auf Medium \u2013 Getting Started with Data Lake, der ziemlich popul\u00e4r geworden ist, wahrscheinlich wegen seiner Einfachheit. Deshalb habe ich beschlossen, ihn auf Deutsch zu schreiben und ein wenig zu erg\u00e4nzen, damit einer Person, die kein Datenexperte ist, verst\u00e4ndlich wird, was ein Data Warehouse (DW) ist und was ein Data Lake ist.","canonical_url":"https:\/\/prohoster.info\/de\/blog\/administrirovanie\/nuzhno-li-nam-ozero-dannyh-a-chto-delat-s-hranilishhem-dannyh","robots":"max-image-preview:large","keywords":"","webmasterTools":{"miscellaneous":""},"schema":null,"og:locale":"de_DE","og:site_name":"ProHoster | \u041a\u0443\u043f\u0438\u0442\u044c \u043d\u0430\u0434\u0435\u0436\u043d\u044b\u0439 \u0445\u043e\u0441\u0442\u0438\u043d\u0433 \u0434\u043b\u044f \u0441\u0430\u0439\u0442\u043e\u0432 \u0441 \u0437\u0430\u0449\u0438\u0442\u043e\u0439 \u043e\u0442 DDoS, VPS VDS \u0441\u0435\u0440\u0432\u0435\u0440\u044b","og:type":"article","og:title":"\ud83e\udd47\u041d\u0443\u0436\u043d\u043e \u043b\u0438 \u043d\u0430\u043c \u043e\u0437\u0435\u0440\u043e \u0434\u0430\u043d\u043d\u044b\u0445? \u0410 \u0447\u0442\u043e \u0434\u0435\u043b\u0430\u0442\u044c \u0441 \u0445\u0440\u0430\u043d\u0438\u043b\u0438\u0449\u0435\u043c \u0434\u0430\u043d\u043d\u044b\u0445? | ProHoster","og:description":"\u042d\u0442\u043e \u0441\u0442\u0430\u0442\u044c\u044f \u043f\u0435\u0440\u0435\u0432\u043e\u0434 \u043c\u043e\u0435\u0439 \u0441\u0442\u0430\u0442\u044c\u0438 \u043d\u0430 medium \u2014 Getting Started with Data Lake, \u043a\u043e\u0442\u043e\u0440\u0430\u044f \u043e\u043a\u0430\u0437\u0430\u043b\u0430\u0441\u044c \u0434\u043e\u0432\u043e\u043b\u044c\u043d\u043e \u043f\u043e\u043f\u0443\u043b\u044f\u0440\u043d\u043e\u0439, \u043d\u0430\u0432\u0435\u0440\u043d\u043e\u0435 \u0438\u0437-\u0437\u0430 \u0441\u0432\u043e\u0435\u0439 \u043f\u0440\u043e\u0441\u0442\u043e\u0442\u044b. \u041f\u043e\u044d\u0442\u043e\u043c\u0443 \u044f \u0440\u0435\u0448\u0438\u043b \u043d\u0430\u043f\u0438\u0441\u0430\u0442\u044c \u0435\u0435 \u043d\u0430 \u0440\u0443\u0441\u0441\u043a\u043e\u043c \u044f\u0437\u044b\u043a\u0435 \u0438 \u043d\u0435\u043c\u043d\u043e\u0433\u043e \u0434\u043e\u043f\u043e\u043b\u043d\u0438\u0442\u044c, \u0447\u0442\u043e\u0431\u044b \u043f\u0440\u043e\u0441\u0442\u043e\u043c\u0443 \u0447\u0435\u043b\u043e\u0432\u0435\u043a\u0443, \u043a\u043e\u0442\u043e\u0440\u044b\u0439 \u043d\u0435 \u044f\u0432\u043b\u044f\u0435\u0442\u0441\u044f \u0441\u043f\u0435\u0446\u0438\u0430\u043b\u0438\u0441\u0442\u043e\u043c \u043f\u043e \u0440\u0430\u0431\u043e\u0442\u0435 \u0441 \u0434\u0430\u043d\u043d\u044b\u043c\u0438 \u0441\u0442\u0430\u043b\u043e \u043f\u043e\u043d\u044f\u0442\u043d\u043e, \u0447\u0442\u043e \u0442\u0430\u043a\u043e\u0435 \u0445\u0440\u0430\u043d\u0438\u043b\u0438\u0449\u0435 \u0434\u0430\u043d\u043d\u044b\u0445 (DW), \u0430 \u0447\u0442\u043e \u0442\u0430\u043a\u043e\u0435 \u043e\u0437\u0435\u0440\u043e \u0434\u0430\u043d\u043d\u044b\u0445","og:url":"https:\/\/prohoster.info\/de\/blog\/administrirovanie\/nuzhno-li-nam-ozero-dannyh-a-chto-delat-s-hranilishhem-dannyh","og:image":"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg","og:image:secure_url":"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg","og:image:width":350,"og:image:height":350,"article:published_time":"2020-01-25T21:00:00+00:00","article:modified_time":"2020-02-18T11:03:50+00:00","article:publisher":"https:\/\/www.facebook.com\/prohoster","article:author":"https:\/\/www.facebook.com\/prohoster"},"aioseo_meta_data":{"post_id":"55701","title":null,"description":null,"keywords":null,"keyphrases":null,"primary_term":null,"canonical_url":null,"og_title":null,"og_description":null,"og_object_type":"default","og_image_type":"default","og_image_url":null,"og_image_width":null,"og_image_height":null,"og_image_custom_url":null,"og_image_custom_fields":null,"og_video":null,"og_custom_url":null,"og_article_section":null,"og_article_tags":null,"twitter_use_og":false,"twitter_card":"default","twitter_image_type":"default","twitter_image_url":null,"twitter_image_custom_url":null,"twitter_image_custom_fields":null,"twitter_title":null,"twitter_description":null,"schema":{"blockGraphs":[],"customGraphs":[],"default":{"data":{"Article":[],"Course":[],"Dataset":[],"FAQPage":[],"Movie":[],"Person":[],"Product":[],"ProductReview":[],"Car":[],"Recipe":[],"Service":[],"SoftwareApplication":[],"WebPage":[]},"graphName":"","isEnabled":true},"graphs":[]},"schema_type":null,"schema_type_options":null,"pillar_content":false,"robots_default":true,"robots_noindex":false,"robots_noarchive":false,"robots_nosnippet":false,"robots_nofollow":false,"robots_noimageindex":false,"robots_noodp":false,"robots_notranslate":false,"robots_max_snippet":null,"robots_max_videopreview":null,"robots_max_imagepreview":"large","priority":null,"frequency":null,"local_seo":null,"seo_analyzer_scan_date":null,"breadcrumb_settings":null,"limit_modified_date":false,"reviewed_by":null,"ai":null,"created":"2021-02-28 19:38:32","updated":"2022-09-27 20:27:01"},"gt_translate_keys":[{"key":"link","format":"url"}],"_links":{"self":[{"href":"https:\/\/prohoster.info\/de\/wp-json\/wp\/v2\/posts\/55701","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/prohoster.info\/de\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/prohoster.info\/de\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/prohoster.info\/de\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/prohoster.info\/de\/wp-json\/wp\/v2\/comments?post=55701"}],"version-history":[{"count":0,"href":"https:\/\/prohoster.info\/de\/wp-json\/wp\/v2\/posts\/55701\/revisions"}],"wp:attachment":[{"href":"https:\/\/prohoster.info\/de\/wp-json\/wp\/v2\/media?parent=55701"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/prohoster.info\/de\/wp-json\/wp\/v2\/categories?post=55701"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/prohoster.info\/de\/wp-json\/wp\/v2\/tags?post=55701"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}