{"id":55701,"date":"2020-01-26T00:00:00","date_gmt":"2020-01-25T21:00:00","guid":{"rendered":"https:\/\/prohoster.info\/blog\/blog_prohoster\/nuzhno-li-nam-ozero-dannyh-a-chto-delat-s-hranilishhem-dannyh"},"modified":"2020-02-18T14:03:50","modified_gmt":"2020-02-18T11:03:50","slug":"nuzhno-li-nam-ozero-dannyh-a-chto-delat-s-hranilishhem-dannyh","status":"publish","type":"post","link":"https:\/\/prohoster.info\/de\/blog\/administrirovanie\/nuzhno-li-nam-ozero-dannyh-a-chto-delat-s-hranilishhem-dannyh","title":{"rendered":"Brauchen wir einen Datensee? Und was ist mit einem Datenspeicher?","gt_translate_keys":[{"key":"rendered","format":"text"}]},"content":{"rendered":"<p>Dieser Artikel ist eine \u00dcbersetzung meines Artikels auf Medium \u2014 <noindex><a rel=\"nofollow\" href=\"https:\/\/medium.com\/rock-your-data\/getting-started-with-data-lake-4bb13643f9\">Erste Schritte mit Data Lake<\/a><\/noindex>, der sich als ziemlich popul\u00e4r herausgestellt hat, wahrscheinlich wegen seiner Einfachheit. Daher habe ich beschlossen, ihn auf Russisch zu schreiben und ein wenig zu erg\u00e4nzen, damit es dem Durchschnittsmenschen, der kein Datenexperte ist, verst\u00e4ndlich wird, was ein Data Warehouse (DW) ist, was ein Data Lake ist und wie sie miteinander koexistieren. <\/p>\n<p>Warum wollte ich \u00fcber Data Lake schreiben? Ich arbeite seit \u00fcber 10 Jahren mit Daten und Analytik, und jetzt arbeite ich definitiv mit Big Data bei Amazon Alexa AI in Cambridge, das in Boston liegt, obwohl ich selbst in Victoria auf Vancouver Island lebe und oft sowohl in Boston, als auch in Seattle und Vancouver bin, und manchmal sogar in Moskau auf Konferenzen spreche. Von Zeit zu Zeit schreibe ich auch, haupts\u00e4chlich auf Englisch, und habe bereits <noindex><a rel=\"nofollow\" href=\"https:\/\/www.amazon.com\/Dmitry-Anoshin\/e\/B01A5PVT2M\">mehrere B\u00fccher<\/a><\/noindex>, ich habe auch das Bed\u00fcrfnis, Trends in der Analytik aus Nordamerika zu teilen, und manchmal schreibe ich in <noindex><a rel=\"nofollow\" href=\"https:\/\/t.me\/rockyourdata\">Telegram<\/a><\/noindex>.<\/p>\n<p>Ich habe immer mit Data Warehouses gearbeitet und seit 2015 intensiv mit Amazon Web Services zu tun, also habe ich insgesamt auf Cloud-Analytik (AWS, Azure, GCP) umgeschaltet. Ich habe die Evolution der Analytikl\u00f6sungen seit 2007 beobachtet und habe sogar selbst bei dem Anbieter von Data Warehouses Teradata gearbeitet und dieses in der Sberbank implementiert, damals begann die \u00c4ra von Big Data mit Hadoop. Alle fingen an zu sagen, dass die \u00c4ra der Data Warehouses vorbei sei und jetzt alles auf Hadoop l\u00e4uft, und sp\u00e4ter begann man schon \u00fcber Data Lake zu sprechen, wiederum, dass es f\u00fcr Data Warehouses jetzt wirklich vorbei sei. Aber zum Gl\u00fcck (vielleicht f\u00fcr einige Ungl\u00fcck, die viel Geld mit der Einrichtung von Hadoop verdient haben), ist das Data Warehouse nicht verschwunden. <br \/>\n<noindex><a rel=\"nofollow\" name=\"habracut\"><\/a><\/noindex><br \/>\nIn diesem Artikel werden wir uns ansehen, was ein Data Lake ist. Der Artikel richtet sich an Menschen, die wenig oder gar keine Erfahrung mit Data Warehouses haben.<\/p>\n<p><img decoding=\"async\" alt=\"Brauchen wir einen Datensee? Und was ist mit einem Datenspeicher?\" src=\"\/wp-content\/uploads\/2020\/01\/85b3eda809ce19fc33efb2fad4e93a41.png\" style=\"display:block;margin: 0 auto;\" \/><br \/>\n<br \/>\nAuf dem Bild ist der Bleder See, eines meiner Lieblingsseen, obwohl ich erst einmal dort war, aber ich werde ihn mein Leben lang in Erinnerung behalten. Aber wir werden \u00fcber einen anderen Typ See sprechen \u2014 den Data Lake. M\u00f6glicherweise haben viele von Ihnen diesen Begriff bereits mehrmals geh\u00f6rt, aber eine weitere Definition kann nie schaden.<\/p>\n<p>Zun\u00e4chst die beliebtesten Definitionen von Data Lake:<\/p>\n<blockquote><p>\u201eEin Dateispeicher f\u00fcr alle Arten roher Daten, die von jedem in der Organisation zur Analyse verf\u00fcgbar sind\u201c \u2014 Martin Fowler.<\/p><\/blockquote>\n<blockquote><p>\u201eWenn Sie denken, dass ein Datensee eine Flasche Wasser ist \u2013 gereinigt, verpackt und f\u00fcr den bequemen Verzehr abgef\u00fcllt, dann ist ein Datensee ein riesiger Beh\u00e4lter mit Wasser in seiner nat\u00fcrlichen Form. Benutzer k\u00f6nnen sich Wasser f\u00fcr sich holen, in die Tiefe tauchen und erkunden\u201c \u2013 James Dixon. <\/p><\/blockquote>\n<p> Jetzt wissen wir genau, dass ein Datensee um Analytik geht; er erm\u00f6glicht es uns, gro\u00dfe Datenmengen in ihrer urspr\u00fcnglichen Form zu speichern und wir haben den n\u00f6tigen und bequemen Zugang zu den Daten.<\/p>\n<p>Ich liebe es oft, Dinge zu vereinfachen. Wenn ich einen komplexen Begriff in einfachen Worten erkl\u00e4ren kann, bedeutet das, dass ich f\u00fcr mich selbst verstanden habe, wie es funktioniert und wof\u00fcr es n\u00fctzlich ist. Neulich habe ich im iPhone in der Fotogalerie herumgest\u00f6bert, und es kam mir in den Sinn, das ist doch ein echter Datensee, ich habe sogar eine Folie f\u00fcr Konferenzen gemacht:<\/p>\n<p><img decoding=\"async\" alt=\"Brauchen wir einen Datensee? Und was ist mit einem Datenspeicher?\" src=\"\/wp-content\/uploads\/2020\/01\/1956ddf4091ca00f6d86c33a6780d495.png\" style=\"display:block;margin: 0 auto;\" \/><br \/>\n<br \/>\nEs ist ganz einfach. Wir machen ein Foto mit dem Handy, das Foto wird auf dem Handy gespeichert und kann in iCloud (Cloud-Speicher) gesichert werden. Auch das Handy sammelt Metadaten des Fotos: was darauf zu sehen ist, Geotag, Zeit. Als Ergebnis k\u00f6nnen wir die benutzerfreundliche Oberfl\u00e4che des iPhones nutzen, um unser Foto zu finden, und dabei sehen wir sogar Kennzahlen. Zum Beispiel finde ich, wenn ich nach Fotos des Begriffs Feuer (fire) suche, 3 Fotos von einem Lagerfeuer. F\u00fcr mich ist das wie ein Business-Intelligence-Tool, das sehr schnell und pr\u00e4zise arbeitet. <\/p>\n<p>Und nat\u00fcrlich d\u00fcrfen wir die Sicherheit (Autorisierung und Authentifizierung) nicht vergessen, sonst k\u00f6nnten unsere Daten leicht \u00f6ffentlich zug\u00e4nglich werden. Es gibt viele Nachrichten \u00fcber gro\u00dfe Unternehmen und Startups, deren Daten aufgrund von Nachl\u00e4ssigkeit der Entwickler in den \u00f6ffentlichen Zugriff geraten sind, weil einfache Regeln nicht beachtet wurden.<\/p>\n<p>Bereits ein so einfaches Bild hilft uns, das Konzept eines Datensees, seine Unterschiede zu traditionellen Datenspeichern und seine grundlegenden Elemente zu verstehen:<\/p>\n<ol>\n<li><b>Daten hochladen <\/b>(Ingestion) \u2013 ein Schl\u00fcsselelement eines Datensees. Daten gelangen auf zwei Arten in den Datenspeicher \u2013 als Batch (Laden in Intervallen) und Streaming (Datenstrom).<\/li>\n<li><b>Dateispeicher<\/b> (Storage) \u2013 das Hauptbestandteil eines Datensees. Es ist wichtig, dass der Speicher leicht skalierbar, \u00e4u\u00dferst zuverl\u00e4ssig und kosteng\u00fcnstig ist. Zum Beispiel bei AWS ist das S3.<\/li>\n<li><b>Katalog und Suche<\/b> (Katalog und Suche) \u2014 um das Datenmoor zu vermeiden (das passiert, wenn wir alle Daten in einen Haufen werfen und dann nicht mehr damit arbeiten k\u00f6nnen), m\u00fcssen wir eine Schicht aus Metadaten zur Klassifizierung der Daten erstellen, damit die Benutzer die Daten, die sie f\u00fcr ihre Analysen ben\u00f6tigen, leicht finden k\u00f6nnen. Dar\u00fcber hinaus k\u00f6nnen zus\u00e4tzliche L\u00f6sungen f\u00fcr die Suche verwendet werden, wie beispielsweise ElasticSearch. Die Suche hilft dem Benutzer, die ben\u00f6tigten Daten \u00fcber eine benutzerfreundliche Oberfl\u00e4che zu finden.<\/li>\n<li><b>Verarbeitung<\/b> (Prozess) \u2014 dieser Schritt ist f\u00fcr die Verarbeitung und Transformation von Daten verantwortlich. Wir k\u00f6nnen Daten transformieren, ihre Strukturen \u00e4ndern, sie bereinigen und vieles mehr. <\/li>\n<li><b>Sicherheit<\/b> (Sicherheit) \u2014 es ist wichtig, Zeit f\u00fcr das Sicherheitsdesign der L\u00f6sung aufzuwenden. Zum Beispiel die Verschl\u00fcsselung von Daten w\u00e4hrend der Speicherung, Verarbeitung und \u00dcbertragung. Es ist wichtig, Authentifizierungs- und Autorisierungsmethoden zu verwenden. Abschlie\u00dfend wird ein Audit-Tool ben\u00f6tigt.<\/li>\n<\/ol>\n<p>\nAus praktischer Sicht k\u00f6nnen wir den Datensee durch drei Attribute charakterisieren:<\/p>\n<ol>\n<li><b>Sammeln und speichern Sie alles<\/b> \u2014 der Datensee enth\u00e4lt alle Daten, sowohl rohe unbewertete Daten \u00fcber jeden Zeitraum als auch verarbeitete\/bereinigte Daten.<\/li>\n<li><b>Tiefgehende Analysen<\/b> \u2014 der Datensee erm\u00f6glicht es Benutzern, Daten zu erkunden und zu analysieren.<\/li>\n<li><b>Flexibler Zugriff<\/b> \u2014 der Datensee gew\u00e4hrleistet flexiblen Zugriff auf unterschiedliche Daten und verschiedene Szenarien.<\/li>\n<\/ol>\n<p>\nJetzt k\u00f6nnen wir \u00fcber den Unterschied zwischen einem Data Warehouse und einem Datensee sprechen. Oft fragen die Leute:<\/p>\n<ul>\n<li>Und wie steht es um das Data Warehouse?<\/li>\n<li>Ersetzen wir das Data Warehouse durch einen Datensee oder erweitern wir es?<\/li>\n<li>Kann man wirklich ohne einen Datensee auskommen?<\/li>\n<\/ul>\n<p>\nKurz gesagt, es gibt keine klare Antwort. Es h\u00e4ngt von der spezifischen Situation, den F\u00e4higkeiten im Team und dem Budget ab. Zum Beispiel die Migration eines Data Warehouse von Oracle nach AWS und die Erstellung eines Datensees durch die Tochtergesellschaft von Amazon \u2014 Woot \u2014 <noindex><a rel=\"nofollow\" href=\"https:\/\/aws.amazon.com\/blogs\/big-data\/our-data-lake-story-how-woot-com-built-a-serverless-data-lake-on-aws\/\">Unsere Datensee-Geschichte: Wie Woot.com einen serverlosen Datensee auf AWS aufgebaut hat.<\/a><\/noindex>. <\/p>\n<p>Andererseits behauptet der Anbieter Snowflake, dass Sie sich nicht mehr um einen Datensee k\u00fcmmern m\u00fcssen, da ihre Datenplattform (bis 2020 war dies ein Data Warehouse) es Ihnen erm\u00f6glicht, sowohl Datensee als auch Data Warehouse zu kombinieren. Ich habe ein wenig mit Snowflake gearbeitet, und es ist tats\u00e4chlich ein einzigartiges Produkt, das das leisten kann. Der Preis ist ein anderes Thema.<\/p>\n<p>Zusammenfassend ist meine pers\u00f6nliche Meinung, dass wir weiterhin ein Data Warehouse als prim\u00e4re Datenquelle f\u00fcr unsere Berichterstattung ben\u00f6tigen, w\u00e4hrend alles, was nicht passt, in einem Data Lake gespeichert wird. Die gesamte Rolle der Analytik besteht darin, dem Unternehmen einen einfachen Zugang zu erm\u00f6glichen, um Entscheidungen zu treffen. Letztendlich arbeiten Gesch\u00e4ftsanwender effizienter mit einem Data Warehouse als mit einem Data Lake; zum Beispiel gibt es bei Amazon Redshift (ein analytisches Data Warehouse) und Redshift Spectrum\/Athena (SQL-Schnittstelle f\u00fcr den Data Lake in S3 auf Basis von Hive\/Presto). Dasselbe gilt f\u00fcr andere moderne analytische Data Warehouses.<\/p>\n<p>Schauen wir uns die typische Architektur eines Data Warehouses an:<\/p>\n<p><img decoding=\"async\" alt=\"Brauchen wir einen Datensee? Und was ist mit einem Datenspeicher?\" src=\"\/wp-content\/uploads\/2020\/01\/a2015f7f5e28e8a671699682105e011e.png\" style=\"display:block;margin: 0 auto;\" \/><br \/>\n<br \/>\nDies ist eine klassische L\u00f6sung. Wir haben Quelldatenquellen, und mit ETL\/ELT kopieren wir die Daten in das analytische Data Warehouse und verbinden es mit einer Business Intelligence-L\u00f6sung (mein Favorit ist Tableau, und Ihrer?). <\/p>\n<p>Solch eine L\u00f6sung hat folgende Nachteile:<\/p>\n<ul>\n<li>ETL\/ELT-Vorg\u00e4nge ben\u00f6tigen Zeit und Ressourcen.<\/li>\n<li>In der Regel ist der Speicherplatz f\u00fcr die Daten in einem analytischen Data Warehouse nicht billig (z.B. Redshift, BigQuery, Teradata), da wir einen ganzen Cluster kaufen m\u00fcssen.<\/li>\n<li>Gesch\u00e4ftsanwender haben Zugriff auf bereinigte und h\u00e4ufig aggregierte Daten und haben nicht die M\u00f6glichkeit, Rohdaten zu erhalten.<\/li>\n<\/ul>\n<p>\nNat\u00fcrlich h\u00e4ngt alles von Ihrem Anwendungsfall ab. Wenn Sie keine Probleme mit Ihrem Data Warehouse haben, ben\u00f6tigen Sie \u00fcberhaupt keinen Data Lake. Aber wenn Probleme mit Platzmangel, Leistung oder Preis eine entscheidende Rolle spielen, kann ein Data Lake in Betracht gezogen werden. Deshalb ist der Data Lake sehr beliebt. Hier ist ein Beispiel f\u00fcr die Architektur eines Data Lakes:<br \/>\n<img decoding=\"async\" alt=\"Brauchen wir einen Datensee? Und was ist mit einem Datenspeicher?\" src=\"\/wp-content\/uploads\/2020\/01\/c952e2202a6ce2c8d7d91215aa5390cc.png\" style=\"display:block;margin: 0 auto;\" \/><br \/>\nDurch die Nutzung des Data Lake-Ansatzes laden wir Rohdaten in unseren Data Lake (Batch oder Streaming) und verarbeiten die Daten nach Bedarf. Der Data Lake erm\u00f6glicht es Gesch\u00e4ftsanwendern, ihre eigenen Daten-Transformierungen (ETL\/ELT) zu erstellen oder Daten in Business Intelligence-L\u00f6sungen zu analysieren (sofern der entsprechende Treiber vorhanden ist).<\/p>\n<blockquote><p>Ziel jeder analytischen L\u00f6sung ist es, den Gesch\u00e4ftsanwendern zu dienen. Daher sollten wir immer von den Anforderungen des Unternehmens ausgehen. (Bei Amazon ist dies eines der Prinzipien \u2013 working backwards).<\/p><\/blockquote>\n<p> Durch die gleichzeitige Arbeit mit einem Data Warehouse und einem Data Lake k\u00f6nnen wir beide L\u00f6sungen vergleichen:<\/p>\n<p><img decoding=\"async\" alt=\"Brauchen wir einen Datensee? Und was ist mit einem Datenspeicher?\" src=\"\/wp-content\/uploads\/2020\/01\/07b62ac9838438a0b28caf1b22b2dccd.png\" style=\"display:block;margin: 0 auto;\" \/><br \/>\n<br \/>\nDie wichtigste Erkenntnis, die man daraus ziehen kann, ist, dass ein Data Warehouse nicht in Konkurrenz zu einem Data Lake steht, sondern ihn vielmehr erg\u00e4nzt. Aber es liegt an Ihnen zu entscheiden, was f\u00fcr Ihren Fall geeignet ist. Es ist immer interessant, es selbst auszuprobieren und die richtigen Schlussfolgerungen zu ziehen.<\/p>\n<p>Ich m\u00f6chte auch \u00fcber einen der F\u00e4lle berichten, in denen ich anfing, den Data-Lake-Ansatz zu nutzen. Es ist alles ziemlich banal, ich versuchte, das ELT-Tool (wir hatten Matillion ETL) und Amazon Redshift zu verwenden, meine L\u00f6sung funktionierte, aber entsprach nicht den Anforderungen.<\/p>\n<p>Ich musste Web-Logs sammeln, sie transformieren und aggregieren, um Daten f\u00fcr zwei F\u00e4lle bereitzustellen:<\/p>\n<ol>\n<li>Das Marketing-Team wollte die Bot-Aktivit\u00e4t f\u00fcr SEO analysieren.<\/li>\n<li>Die IT wollte die Metriken zur Leistung der Websites \u00fcberwachen.<\/li>\n<\/ol>\n<p>\nSehr einfache, sehr banale Logs. Hier ein Beispiel:<\/p>\n<pre><code class=\"plaintext\">https 2018-07-02T22:23:00.186641Z app\/my-loadbalancer\/50dc6c495c0c9188 \n192.168.131.39:2817 10.0.0.1:80 0.086 0.048 0.037 200 200 0 57 \n\"GET https:\/\/www.example.com:443\/ HTTP\/1.1\" \"curl\/7.46.0\" ECDHE-RSA-AES128-GCM-SHA256 TLSv1.2 \narn:aws:elasticloadbalancing:us-east-2:123456789012:targetgroup\/my-targets\/73e2d6bc24d8a067\n\"Root=1-58337281-1d84f3d73c47ec4e58577259\" \"www.example.com\" \"arn:aws:acm:us-east-2:123456789012:certificate\/12345678-1234-1234-1234-123456789012\"\n1 2018-07-02T22:22:48.364000Z \"authenticate,forward\" \"-\" \"-\"<\/code><\/pre>\n<p>\nEine Datei hatte ein Gewicht von 1-4 Megabyte.<\/p>\n<p>Aber es gab ein Problem. Wir hatten 7 Domains weltweit, und an einem Tag wurden 7000 Dateien erstellt. Das ist nicht sehr viel, insgesamt 50 Gigabyte. Aber die Gr\u00f6\u00dfe unseres Redshift-Clusters war auch recht klein (4 Knoten). Das traditionelle Hochladen einer Datei dauerte etwa eine Minute. Das hei\u00dft, die Aufgabe lie\u00df sich nicht direkt l\u00f6sen. Und das war der Fall, als ich beschloss, den Data-Lake-Ansatz zu nutzen. Die L\u00f6sung sah ungef\u00e4hr so aus:<\/p>\n<p><img decoding=\"async\" alt=\"Brauchen wir einen Datensee? Und was ist mit einem Datenspeicher?\" src=\"\/wp-content\/uploads\/2020\/01\/21ca33e82da56f83b3deab4c32eb2345.png\" style=\"display:block;margin: 0 auto;\" \/><br \/>\n<br \/>\nSie ist recht einfach (ich m\u00f6chte anmerken, dass der Vorteil der Arbeit in der Cloud die Einfachheit ist). Ich verwendete:<\/p>\n<ul>\n<li>AWS Elastic Map Reduce (Hadoop) als Rechenleistung. <\/li>\n<li>AWS S3 als Dateispeicher mit der M\u00f6glichkeit zur Datenverschl\u00fcsselung und Zugriffsregulierung.<\/li>\n<li>Spark als In-Memory-Rechenleistung und PySpark f\u00fcr die Logik und Datenumwandlung.<\/li>\n<li>Parquet als Ergebnis der Spark-Verarbeitung.<\/li>\n<li>AWS Glue Crawler als Metadaten-Collector f\u00fcr neue Daten und Partitionen.<\/li>\n<li>Redshift Spectrum als SQL-Schnittstelle zum Data Lake f\u00fcr bestehende Redshift-Benutzer.<\/li>\n<\/ul>\n<p>\nDer kleinste EMR+Spark-Cluster bearbeitete alle Paketdateien in 30 Minuten. Es gibt auch andere Anwendungsf\u00e4lle f\u00fcr AWS, besonders viele sind mit Alexa verbunden, wo es eine gro\u00dfe Menge an Daten gibt. <\/p>\n<p>Vor Kurzem habe ich einen der Nachteile eines Data Lakes kennengelernt \u2013 die DSGVO. Das Problem ist, dass, wenn ein Kunde die L\u00f6schung seiner Daten verlangt und sich diese in einer der Dateien befinden, wir keine Data Manipulation Language und keinen DELETE-Befehl wie in einer Datenbank verwenden k\u00f6nnen.<\/p>\n<p>Ich hoffe, der Artikel hat den Unterschied zwischen einem Data Warehouse und einem Data Lake erkl\u00e4rt. Wenn es interessant war, kann ich gerne weitere meiner Artikel oder Artikel von Fachleuten, die ich lese, \u00fcbersetzen. Au\u00dferdem kann ich \u00fcber die L\u00f6sungen berichten, mit denen ich arbeite, und deren Architektur.<br \/>\n<br \/>Quelle: <a content=\"nofollow\" rel=\"nofollow\" href=\"https:\/\/habr.com\/ru\/post\/485180\/\">habr.com<\/a><\/p>","protected":false,"gt_translate_keys":[{"key":"rendered","format":"html"}]},"excerpt":{"rendered":"<p>\u042d\u0442\u043e \u0441\u0442\u0430\u0442\u044c\u044f \u043f\u0435\u0440\u0435\u0432\u043e\u0434 \u043c\u043e\u0435\u0439 \u0441\u0442\u0430\u0442\u044c\u0438 \u043d\u0430 medium \u2014 Getting Started with Data Lake, \u043a\u043e\u0442\u043e\u0440\u0430\u044f \u043e\u043a\u0430\u0437\u0430\u043b\u0430\u0441\u044c \u0434\u043e\u0432\u043e\u043b\u044c\u043d\u043e \u043f\u043e\u043f\u0443\u043b\u044f\u0440\u043d\u043e\u0439, \u043d\u0430\u0432\u0435\u0440\u043d\u043e\u0435 \u0438\u0437-\u0437\u0430 \u0441\u0432\u043e\u0435\u0439 \u043f\u0440\u043e\u0441\u0442\u043e\u0442\u044b. \u041f\u043e\u044d\u0442\u043e\u043c\u0443 \u044f \u0440\u0435\u0448\u0438\u043b \u043d\u0430\u043f\u0438\u0441\u0430\u0442\u044c \u0435\u0435 \u043d\u0430 \u0440\u0443\u0441\u0441\u043a\u043e\u043c \u044f\u0437\u044b\u043a\u0435 \u0438 \u043d\u0435\u043c\u043d\u043e\u0433\u043e \u0434\u043e\u043f\u043e\u043b\u043d\u0438\u0442\u044c, \u0447\u0442\u043e\u0431\u044b \u043f\u0440\u043e\u0441\u0442\u043e\u043c\u0443 \u0447\u0435\u043b\u043e\u0432\u0435\u043a\u0443, \u043a\u043e\u0442\u043e\u0440\u044b\u0439 \u043d\u0435 \u044f\u0432\u043b\u044f\u0435\u0442\u0441\u044f \u0441\u043f\u0435\u0446\u0438\u0430\u043b\u0438\u0441\u0442\u043e\u043c \u043f\u043e \u0440\u0430\u0431\u043e\u0442\u0435 \u0441 \u0434\u0430\u043d\u043d\u044b\u043c\u0438 \u0441\u0442\u0430\u043b\u043e \u043f\u043e\u043d\u044f\u0442\u043d\u043e, \u0447\u0442\u043e \u0442\u0430\u043a\u043e\u0435 \u0445\u0440\u0430\u043d\u0438\u043b\u0438\u0449\u0435 \u0434\u0430\u043d\u043d\u044b\u0445 (DW), \u0430 \u0447\u0442\u043e \u0442\u0430\u043a\u043e\u0435 \u043e\u0437\u0435\u0440\u043e \u0434\u0430\u043d\u043d\u044b\u0445 [&hellip;]<\/p>\n","protected":false,"gt_translate_keys":[{"key":"rendered","format":"html"}]},"author":1,"featured_media":0,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[688],"tags":[],"class_list":["post-55701","post","type-post","status-publish","format-standard","hentry","category-administrirovanie"],"aioseo_notices":[],"aioseo_head":"\n\t\t<!-- All in One SEO 5.0.1.1 - aioseo.com -->\n\t<meta name=\"description\" content=\"\u042d\u0442\u043e \u0441\u0442\u0430\u0442\u044c\u044f \u043f\u0435\u0440\u0435\u0432\u043e\u0434 \u043c\u043e\u0435\u0439 \u0441\u0442\u0430\u0442\u044c\u0438 \u043d\u0430 medium \u2014 Getting Started with Data Lake.\" \/>\n\t<meta name=\"robots\" content=\"max-image-preview:large\" \/>\n\t<meta name=\"author\" content=\"Yuri Gagarin\"\/>\n\t<link rel=\"canonical\" href=\"https:\/\/prohoster.info\/de\/blog\/administrirovanie\/nuzhno-li-nam-ozero-dannyh-a-chto-delat-s-hranilishhem-dannyh\" \/>\n\t<meta name=\"generator\" content=\"All in One SEO (AIOSEO) 5.0.1.1\" \/>\n\t\t<meta property=\"og:locale\" content=\"de_DE\" \/>\n\t\t<meta property=\"og:site_name\" content=\"ProHoster | \u041a\u0443\u043f\u0438\u0442\u044c \u043d\u0430\u0434\u0435\u0436\u043d\u044b\u0439 \u0445\u043e\u0441\u0442\u0438\u043d\u0433 \u0434\u043b\u044f \u0441\u0430\u0439\u0442\u043e\u0432 \u0441 \u0437\u0430\u0449\u0438\u0442\u043e\u0439 \u043e\u0442 DDoS, VPS VDS \u0441\u0435\u0440\u0432\u0435\u0440\u044b\" \/>\n\t\t<meta property=\"og:type\" content=\"article\" \/>\n\t\t<meta property=\"og:title\" content=\"\ud83e\udd47\u041d\u0443\u0436\u043d\u043e \u043b\u0438 \u043d\u0430\u043c \u043e\u0437\u0435\u0440\u043e \u0434\u0430\u043d\u043d\u044b\u0445? \u0410 \u0447\u0442\u043e \u0434\u0435\u043b\u0430\u0442\u044c \u0441 \u0445\u0440\u0430\u043d\u0438\u043b\u0438\u0449\u0435\u043c \u0434\u0430\u043d\u043d\u044b\u0445? | ProHoster\" \/>\n\t\t<meta property=\"og:description\" content=\"\u042d\u0442\u043e \u0441\u0442\u0430\u0442\u044c\u044f \u043f\u0435\u0440\u0435\u0432\u043e\u0434 \u043c\u043e\u0435\u0439 \u0441\u0442\u0430\u0442\u044c\u0438 \u043d\u0430 medium \u2014 Getting Started with Data Lake.\" \/>\n\t\t<meta property=\"og:url\" content=\"https:\/\/prohoster.info\/de\/blog\/administrirovanie\/nuzhno-li-nam-ozero-dannyh-a-chto-delat-s-hranilishhem-dannyh\" \/>\n\t\t<meta property=\"og:image\" content=\"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg\" \/>\n\t\t<meta property=\"og:image:secure_url\" content=\"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg\" \/>\n\t\t<meta property=\"og:image:width\" content=\"350\" \/>\n\t\t<meta property=\"og:image:height\" content=\"350\" \/>\n\t\t<meta property=\"article:published_time\" content=\"2020-01-25T21:00:00+00:00\" \/>\n\t\t<meta property=\"article:modified_time\" content=\"2020-02-18T11:03:50+00:00\" \/>\n\t\t<meta property=\"article:publisher\" content=\"https:\/\/www.facebook.com\/prohoster\" \/>\n\t\t<meta property=\"article:author\" content=\"https:\/\/www.facebook.com\/prohoster\" \/>\n\t\t<!-- All in One SEO -->\n\n","aioseo_head_json":{"title":"\ud83e\udd47Brauchen wir einen Data Lake? Was ist mit einem Data Warehouse? | ProHoster","description":"Das ist die \u00dcbersetzung meines Artikels auf Medium \u2013 Getting Started with Data Lake.","canonical_url":"https:\/\/prohoster.info\/de\/blog\/administrirovanie\/nuzhno-li-nam-ozero-dannyh-a-chto-delat-s-hranilishhem-dannyh","robots":"max-image-preview:large","keywords":"","webmasterTools":{"miscellaneous":""},"schema":null,"og:locale":"de_DE","og:site_name":"ProHoster | \u041a\u0443\u043f\u0438\u0442\u044c \u043d\u0430\u0434\u0435\u0436\u043d\u044b\u0439 \u0445\u043e\u0441\u0442\u0438\u043d\u0433 \u0434\u043b\u044f \u0441\u0430\u0439\u0442\u043e\u0432 \u0441 \u0437\u0430\u0449\u0438\u0442\u043e\u0439 \u043e\u0442 DDoS, VPS VDS \u0441\u0435\u0440\u0432\u0435\u0440\u044b","og:type":"article","og:title":"\ud83e\udd47\u041d\u0443\u0436\u043d\u043e \u043b\u0438 \u043d\u0430\u043c \u043e\u0437\u0435\u0440\u043e \u0434\u0430\u043d\u043d\u044b\u0445? \u0410 \u0447\u0442\u043e \u0434\u0435\u043b\u0430\u0442\u044c \u0441 \u0445\u0440\u0430\u043d\u0438\u043b\u0438\u0449\u0435\u043c \u0434\u0430\u043d\u043d\u044b\u0445? | ProHoster","og:description":"\u042d\u0442\u043e \u0441\u0442\u0430\u0442\u044c\u044f \u043f\u0435\u0440\u0435\u0432\u043e\u0434 \u043c\u043e\u0435\u0439 \u0441\u0442\u0430\u0442\u044c\u0438 \u043d\u0430 medium \u2014 Getting Started with Data Lake.","og:url":"https:\/\/prohoster.info\/de\/blog\/administrirovanie\/nuzhno-li-nam-ozero-dannyh-a-chto-delat-s-hranilishhem-dannyh","og:image":"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg","og:image:secure_url":"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg","og:image:width":350,"og:image:height":350,"article:published_time":"2020-01-25T21:00:00+00:00","article:modified_time":"2020-02-18T11:03:50+00:00","article:publisher":"https:\/\/www.facebook.com\/prohoster","article:author":"https:\/\/www.facebook.com\/prohoster"},"aioseo_meta_data":{"post_id":"55701","title":null,"description":null,"keywords":null,"keyphrases":null,"primary_term":null,"canonical_url":null,"og_title":null,"og_description":null,"og_object_type":"default","og_image_type":"default","og_image_url":null,"og_image_width":null,"og_image_height":null,"og_image_custom_url":null,"og_image_custom_fields":null,"og_video":null,"og_custom_url":null,"og_article_section":null,"og_article_tags":null,"twitter_use_og":false,"twitter_card":"default","twitter_image_type":"default","twitter_image_url":null,"twitter_image_custom_url":null,"twitter_image_custom_fields":null,"twitter_title":null,"twitter_description":null,"schema":{"blockGraphs":[],"customGraphs":[],"default":{"data":{"Article":[],"Course":[],"Dataset":[],"FAQPage":[],"Movie":[],"Person":[],"Product":[],"ProductReview":[],"Car":[],"Recipe":[],"Service":[],"SoftwareApplication":[],"WebPage":[]},"graphName":"","isEnabled":true},"graphs":[]},"schema_type":null,"schema_type_options":null,"pillar_content":false,"robots_default":true,"robots_noindex":false,"robots_noarchive":false,"robots_nosnippet":false,"robots_nofollow":false,"robots_noimageindex":false,"robots_noodp":false,"robots_notranslate":false,"robots_max_snippet":null,"robots_max_videopreview":null,"robots_max_imagepreview":"large","priority":null,"frequency":null,"local_seo":null,"seo_analyzer_scan_date":null,"breadcrumb_settings":null,"limit_modified_date":false,"reviewed_by":null,"ai":null,"created":"2021-02-28 19:38:32","updated":"2022-09-27 20:27:01","focus_keyword":null,"additional_keywords":null,"truseo_locale":null},"gt_translate_keys":[{"key":"link","format":"url"}],"_links":{"self":[{"href":"https:\/\/prohoster.info\/de\/wp-json\/wp\/v2\/posts\/55701","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/prohoster.info\/de\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/prohoster.info\/de\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/prohoster.info\/de\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/prohoster.info\/de\/wp-json\/wp\/v2\/comments?post=55701"}],"version-history":[{"count":0,"href":"https:\/\/prohoster.info\/de\/wp-json\/wp\/v2\/posts\/55701\/revisions"}],"wp:attachment":[{"href":"https:\/\/prohoster.info\/de\/wp-json\/wp\/v2\/media?parent=55701"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/prohoster.info\/de\/wp-json\/wp\/v2\/categories?post=55701"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/prohoster.info\/de\/wp-json\/wp\/v2\/tags?post=55701"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}