{"id":84416,"date":"2020-06-07T13:42:50","date_gmt":"2020-06-07T11:42:50","guid":{"rendered":"https:\/\/prohoster.info\/blog\/administrirovanie\/formaty-fajlov-v-bolshih-dannyh-kratkij-likbez"},"modified":"2020-06-07T13:42:50","modified_gmt":"2020-06-07T11:42:50","slug":"formaty-fajlov-v-bolshih-dannyh-kratkij-likbez","status":"publish","type":"post","link":"https:\/\/prohoster.info\/de\/blog\/administrirovanie\/formaty-fajlov-v-bolshih-dannyh-kratkij-likbez","title":{"rendered":"Dateiformate in Big Data: Eine kurze Einf\u00fchrung","gt_translate_keys":[{"key":"rendered","format":"text"}]},"content":{"rendered":"<p><img decoding=\"async\" alt=\"Dateiformate in Big Data: Eine kurze Einf\u00fchrung\" src=\"\/wp-content\/uploads\/2020\/06\/c909979e0474bc6a1f7234cd88167220.png\" style=\"display:block;margin: 0 auto;\" \/><br \/>\n<noindex><a rel=\"nofollow\" href=\"https:\/\/www.deviantart.com\/remarin\/art\/Weather-Deity-743892889\"><i>Wettergott von Remarin<\/i><\/a><\/noindex> <\/p>\n<p>Der Befehl <noindex><a rel=\"nofollow\" href=\"https:\/\/mcs.mail.ru\/\">Mail.ru Cloud L\u00f6sungen<\/a><\/noindex> bietet <noindex><a rel=\"nofollow\" href=\"https:\/\/blog.clairvoyantsoft.com\/big-data-file-formats-3fb659903271\">eine \u00dcbersetzung des Artikels<\/a><\/noindex> Ingenieur Rahul Bhati von Clairvoyant erkl\u00e4rt, welche Dateiformate in Big Data existieren, welche Funktionen von Hadoop-Formaten am h\u00e4ufigsten sind und welches Format am besten verwendet werden sollte.<br \/>\n<noindex><a rel=\"nofollow\" name=\"habracut\"><\/a><\/noindex><\/p>\n<h2>Warum gibt es verschiedene Dateiformate?<\/h2>\n<p>\nEin ernsthaftes Engpassproblem in der Leistung von HDFS-unterst\u00fctzenden Anwendungen wie MapReduce und Spark ist die Zeit f\u00fcr das Suchen, Lesen und Schreiben von Daten. Diese Probleme werden durch Schwierigkeiten im Umgang mit gro\u00dfen Datens\u00e4tzen versch\u00e4rft, wenn wir kein festes, sondern ein sich entwickelndes Schema haben oder wenn es Einschr\u00e4nkungen f\u00fcr die Speicherung gibt.<\/p>\n<p>Die Verarbeitung von Big Data erh\u00f6ht die Belastung des Speichersystems \u2014 Hadoop speichert Daten redundant, um Ausfallsicherheit zu gew\u00e4hrleisten. Neben den Festplatten werden auch Prozessor, Netzwerk, Ein- und Ausgabesystem und weitere Komponenten belastet. Mit dem Wachstum des Datenvolumens steigen auch die Kosten f\u00fcr deren Verarbeitung und Speicherung.<\/p>\n<p>Verschiedene Dateiformate in <noindex><a rel=\"nofollow\" href=\"https:\/\/mcs.mail.ru\/blog\/zachem-nuzhen-hadoop\">Hadoop<\/a><\/noindex> wurden entwickelt, um genau diese Probleme zu l\u00f6sen. Die Wahl des richtigen Dateiformats kann erhebliche Vorteile bringen:<\/p>\n<ol>\n<li>Schnelleres Lesezeiten.<\/li>\n<li>Schnelleres Schreibzeiten.<\/li>\n<li>Teilebare Dateien.<\/li>\n<li>Unterst\u00fctzung der Evolution von Schemata.<\/li>\n<li>Erweiterte Unterst\u00fctzung f\u00fcr Komprimierung.<\/li>\n<\/ol>\n<p>\nEinige Dateiformate sind f\u00fcr den allgemeinen Gebrauch gedacht, andere f\u00fcr spezifischere Varianten, und einige sind f\u00fcr spezielle Dateneigenschaften entwickelt worden. Die Auswahl ist also tats\u00e4chlich ziemlich gro\u00df.<\/p>\n<h2>Avro-Dateiformat<\/h2>\n<p>\nF\u00fcr <i>Datenserialisierung <\/i>Avro wird weit verbreitet genutzt \u2014 es handelt sich um <i>ein zeilenbasiertes<\/i>, also zeilenorientiertes, Datenformat f\u00fcr die Speicherung in Hadoop. Es speichert das Schema im JSON-Format, was das Lesen und Interpretieren durch jede Software erleichtert. Die Daten selbst liegen im bin\u00e4ren Format vor, kompakt und effizient.<\/p>\n<p>Das Avro-Serialisierungssystem ist sprachneutral. Dateien k\u00f6nnen in verschiedenen Programmiersprachen verarbeitet werden, derzeit C, C++, C#, Java, Python und Ruby.<\/p>\n<p>Ein Schl\u00fcsselmerkmal von Avro ist die zuverl\u00e4ssige Unterst\u00fctzung von Datenschemata, die sich im Laufe der Zeit \u00e4ndern, also evolvieren. Avro versteht die Schema\u00e4nderungen \u2014 das Entfernen, Hinzuf\u00fcgen oder \u00c4ndern von Feldern.<\/p>\n<p>Avro unterst\u00fctzt eine Vielzahl von Datenstrukturen. Beispielsweise kann man einen Datensatz erstellen, der ein Array, einen enumerierten Typ und ein Sublayout enth\u00e4lt.<\/p>\n<p><img decoding=\"async\" alt=\"Dateiformate in Big Data: Eine kurze Einf\u00fchrung\" src=\"\/wp-content\/uploads\/2020\/06\/9bf044329ac0980a48a125c505dee265.png\" style=\"display:block;margin: 0 auto;\" \/><br \/>\nDieses Format eignet sich hervorragend zur Speicherung im Landing (Staging) Bereich eines Data Lakes (<noindex><a rel=\"nofollow\" href=\"https:\/\/mcs.mail.ru\/blog\/chto-takoe-ozera-dannyh-i-zachem-tam-hranyat-big-data\">Data Lake<\/a><\/noindex>, eine Sammlung von Instanzen zur Speicherung verschiedener Datentypen zus\u00e4tzlich zu den tats\u00e4chlichen Datenquellen). <\/p>\n<p>F\u00fcr die Speicherung im Staging-Bereich eines Data Lakes ist dieses Format aus folgenden Gr\u00fcnden am besten geeignet:<\/p>\n<ol>\n<li>Daten aus diesem Bereich werden in der Regel vollst\u00e4ndig f\u00fcr die weitere Verarbeitung durch nachgelagerte Systeme gelesen, und in diesem Fall ist das zeilenbasierte Format effizienter.<\/li>\n<li>Nachgelagerte Systeme k\u00f6nnen Schematabellen problemlos aus Dateien extrahieren \u2013 es ist nicht n\u00f6tig, Schemas separat in einem externen Metastore zu speichern.<\/li>\n<li>\u00c4nderungen am urspr\u00fcnglichen Schema lassen sich leicht verarbeiten (Schema-Evolution).<\/li>\n<\/ol>\n<p><\/p>\n<h2>Das Parquet-Format<\/h2>\n<p>\nParquet ist ein Open-Source-Dateiformat f\u00fcr Hadoop, das <i>v verschachtelte Datenstrukturen in einem flachen Spaltenformat speichert.<\/i>.<\/p>\n<p>Im Vergleich zum traditionellen zeilenbasierten Ansatz ist Parquet in Bezug auf Speicherplatz und Leistung effizienter.<\/p>\n<p>Dies ist besonders n\u00fctzlich f\u00fcr Abfragen, die bestimmte Spalten aus einer breiten Tabelle mit vielen Spalten auslesen. Dank des Dateiformats werden nur die ben\u00f6tigten Spalten gelesen, sodass Ein- und Ausgabe minimiert werden.<\/p>\n<p><strong>Eine kleine Exkurs-Erkl\u00e4rung<\/strong>: Um das Parquet-Dateiformat in Hadoop besser zu verstehen, schauen wir uns an, was ein spaltenbasierter, also columnar, Format ist. In diesem Format werden homogener Werte jeder Spalte zusammen gespeichert. <\/p>\n<p><noindex><a rel=\"nofollow\" href=\"http:\/\/netjs.blogspot.com\/\">Zum Beispiel<\/a><\/noindex>, der Datensatz umfasst die Felder ID, Name und Abteilung. In diesem Fall werden alle Werte der Spalte ID zusammen gespeichert, ebenso die Werte der Spalte Name und so weiter. Die Tabelle sieht etwa so aus:<\/p>\n<p><strong>ID<\/strong><br \/>\n<strong>Name<\/strong><br \/>\n<strong>Abteilung<\/strong><\/p>\n<p>1<br \/>\nMitarbeiter1<br \/>\nd1<\/p>\n<p>2<br \/>\nMitarbeiter2<br \/>\nd2<\/p>\n<p>3<br \/>\nMitarbeiter3<br \/>\nd3<\/p>\n<p>\nIm Zeilenformat werden die Daten folgenderma\u00dfen gespeichert:<\/p>\n<p>1<br \/>\nMitarbeiter1<br \/>\nd1<br \/>\n2<br \/>\nMitarbeiter2<br \/>\nd2<br \/>\n3<br \/>\nMitarbeiter3<br \/>\nd3<\/p>\n<p>\nIm spaltenbasierten Format werden dieselben Daten so gespeichert:<\/p>\n<p>1<br \/>\n2<br \/>\n3<br \/>\nMitarbeiter1<br \/>\nMitarbeiter2<br \/>\nMitarbeiter3<br \/>\nd1<br \/>\nd2<br \/>\nd3<\/p>\n<p>\nDas spaltenbasierte Format ist effizienter, wenn Sie mehrere Spalten aus einer Tabelle anfragen m\u00fcssen. Es werden nur die ben\u00f6tigten Spalten gelesen, da sie sich nahe beieinander befinden. So werden Ein- und Ausgabe minimiert.<\/p>\n<p>Zum Beispiel ben\u00f6tigen Sie nur die Spalte NAME. Im<noindex><a rel=\"nofollow\" href=\"http:\/\/netjs.blogspot.com\/\"> Zeilenformat<\/a><\/noindex> Jeder Datensatz im Dataset muss geladen, in Felder zerlegt und dann die NAME-Daten extrahiert werden. Das Spaltenformat erm\u00f6glicht den direkten Zugriff auf die Spalte Name, da alle Werte f\u00fcr diese Spalte zusammen gespeichert werden. Es ist nicht erforderlich, den gesamten Datensatz zu durchsuchen.<\/p>\n<p>Das Spaltenformat erh\u00f6ht somit die Abfrageleistung, da weniger Zeit f\u00fcr die Suche nach den ben\u00f6tigten Spalten erforderlich ist und die Anzahl der Ein- und Ausgabeoperationen reduziert wird, da nur die erforderlichen Spalten gelesen werden.<\/p>\n<p>Eine der einzigartigen Eigenschaften<noindex><a rel=\"nofollow\" href=\"http:\/\/netjs.blogspot.com\/\"> Parquet<\/a><\/noindex> ist, dass dieses Format <i>Daten mit verschachtelten Strukturen<\/i>speichern kann. Das bedeutet, dass in einer Parquet-Datei auch verschachtelte Felder einzeln gelesen werden k\u00f6nnen, ohne dass alle Felder in der verschachtelten Struktur gelesen werden m\u00fcssen. F\u00fcr die Speicherung verschachtelter Strukturen verwendet Parquet den Algorithmus f\u00fcr Zerschlagung und Zusammenbau (shredding and assembly).<\/p>\n<p><img decoding=\"async\" alt=\"Dateiformate in Big Data: Eine kurze Einf\u00fchrung\" src=\"\/wp-content\/uploads\/2020\/06\/8cba9a4faccc4bac7c5bbc3eec163a3c.png\" style=\"display:block;margin: 0 auto;\" \/><br \/>\nUm das Parquet-Dateiformat in Hadoop zu verstehen, m\u00fcssen die folgenden Begriffe bekannt sein:<\/p>\n<ol>\n<li><strong>Zeilengruppe<\/strong> (row group): eine logische horizontale Unterteilung der Daten in Zeilen. Eine Zeilengruppe besteht aus einem Fragment jeder Spalte im Dataset.<\/li>\n<li><strong>Spaltenfragment<\/strong> (column chunk): ein spezifischer Spaltenausschnitt. Diese Spaltenfragmente leben in einer bestimmten Gruppe von Zeilen und sind im Datei garantiert benachbart.<\/li>\n<li><strong>Seite<\/strong> (page): Spaltenfragmente sind auf Seiten aufgeteilt, die nacheinander aufgezeichnet sind. Seiten haben einen gemeinsamen Header, sodass beim Lesen Unn\u00f6tiges \u00fcbersprungen werden kann.<\/li>\n<\/ol>\n<p>\n<img decoding=\"async\" alt=\"Dateiformate in Big Data: Eine kurze Einf\u00fchrung\" src=\"\/wp-content\/uploads\/2020\/06\/0f3d583bc2f07b6fef8430f10433cc14.png\" style=\"display:block;margin: 0 auto;\" \/><br \/>\nHier enth\u00e4lt der Header einfach eine magische Zahl <i>PAR1<\/i> (4 Bytes), die die Datei als eine Parquet-Datei identifizieren.<\/p>\n<p>Im Footer steht Folgendes:<\/p>\n<ol>\n<li>Metadaten der Datei, die die Startkoordinaten der Metadaten jeder Spalte enthalten. Beim Lesen m\u00fcssen zuerst die Metadaten der Datei gelesen werden, um alle interessanten Spaltenfragmente zu finden. Dann sollten die Spaltenfragmente nacheinander gelesen werden. Die Metadaten umfassen auch die Formatversion, das Schema und beliebige zus\u00e4tzliche Schl\u00fcssel-Wert-Paare.<\/li>\n<li>L\u00e4nge der Metadaten (4 Bytes).<\/li>\n<li>Die magische Zahl <i>PAR1<\/i> (4 Bytes).<\/li>\n<\/ol>\n<p><\/p>\n<h2>ORC-Dateiformate<\/h2>\n<p>\n<i>Optimiertes zeilen- und spaltenbasiertes Dateiformat<\/i> (Optimized Row Columnar, <noindex><a rel=\"nofollow\" href=\"https:\/\/orc.apache.org\/\">ORC<\/a><\/noindex>) bietet eine sehr effiziente M\u00f6glichkeit zur Datenspeicherung und wurde entwickelt, um die Einschr\u00e4nkungen anderer Formate zu \u00fcberwinden. Es speichert Daten in perfekt kompakter Form und l\u00e4sst \u00fcberfl\u00fcssige Details weg, ohne dass enorme, komplexe oder wartungsintensive Indizes erstellt werden m\u00fcssen. <\/p>\n<p>Vorteile des ORC-Formats:<\/p>\n<ol>\n<li>Eine Datei pro Aufgabe, was die Last auf den NameNode (Namenszentrum) verringert.<\/li>\n<li>Unterst\u00fctzung von Hive-Datentypen, einschlie\u00dflich DateTime, Dezimal- und komplexen Datentypen (Struct, List, Map und Union).<\/li>\n<li>Gleichzeitiges Lesen derselben Datei durch verschiedene RecordReader-Prozesse.<\/li>\n<li>M\u00f6glichkeit der Trennung von Dateien ohne Scannen auf Marker.<\/li>\n<li>Einsch\u00e4tzung des maximalen Heap-Speicherplatzes f\u00fcr Lese-\/Schreibprozesse anhand der Informationen im Footer der Datei.<\/li>\n<li>Metadaten werden im bin\u00e4ren Format der Protocol Buffers-Serialisierung gespeichert, das das Hinzuf\u00fcgen und Entfernen von Feldern erm\u00f6glicht.<\/li>\n<\/ol>\n<p>\n<img decoding=\"async\" alt=\"Dateiformate in Big Data: Eine kurze Einf\u00fchrung\" src=\"\/wp-content\/uploads\/2020\/06\/342a51df1730398d5280484407461d8c.png\" style=\"display:block;margin: 0 auto;\" \/><br \/>\nORC speichert Sammlungen von Zeilen in einer Datei, wobei die Zeilendaten innerhalb der Sammlung im spaltenbasierten Format gespeichert werden.<\/p>\n<p>Die ORC-Datei speichert Gruppen von Zeilen, die Streifen (stripes) genannt werden, sowie erg\u00e4nzende Informationen im Fu\u00dfbereich der Datei. Der Postscript am Ende der Datei enth\u00e4lt Komprimierungsparameter und die Gr\u00f6\u00dfe des komprimierten Fu\u00dfbereichs.<\/p>\n<p>Standardm\u00e4\u00dfig betr\u00e4gt die Gr\u00f6\u00dfe eines Streifens 250 MB. Durch Streifen dieser Gr\u00f6\u00dfe erfolgt das Lesen aus HDFS effizienter: in gro\u00dfen, kontinuierlichen Bl\u00f6cken.<\/p>\n<p>Im Fu\u00dfbereich der Datei ist eine Liste der Streifen, die Anzahl der Zeilen pro Streifen und der Datentyp jeder Spalte aufgezeichnet. Dort sind auch die resultierenden Werte f\u00fcr count, min, max und sum f\u00fcr jede Spalte aufgef\u00fchrt.<\/p>\n<p>Der Fu\u00dfbereich des Streifens enth\u00e4lt ein Verzeichnis von Standorten des Streams.<\/p>\n<p>Zeilendaten werden beim Scannen von Tabellen verwendet.<\/p>\n<p>Indizes enthalten die minimalen und maximalen Werte f\u00fcr jede Spalte sowie die Position der Zeilen in jeder Spalte. ORC-Indizes werden ausschlie\u00dflich zur Auswahl von Streifen und Zeilengruppen verwendet, nicht zur Beantwortung von Abfragen.<\/p>\n<h2>Vergleich verschiedener Dateiformate<\/h2>\n<p><\/p>\n<h3>Avro im Vergleich zu Parquet<\/h3>\n<p><\/p>\n<ol>\n<li>Avro ist ein zeilenbasiertes Speicherformat, w\u00e4hrend Parquet Daten spaltenweise speichert.<\/li>\n<li>Parquet eignet sich besser f\u00fcr analytische Abfragen, das hei\u00dft, Lese- und Datenabfrageoperationen sind wesentlich effizienter als Schreibvorg\u00e4nge.<\/li>\n<li>Die Schreibvorg\u00e4nge in Avro sind effizienter als in Parquet.<\/li>\n<li>Avro funktioniert reifer mit der Schema-Evolution. Parquet unterst\u00fctzt nur das Hinzuf\u00fcgen von Schemas, w\u00e4hrend Avro eine vielseitige Evolution erm\u00f6glicht, d.h. das Hinzuf\u00fcgen oder \u00c4ndern von Spalten.<\/li>\n<li>Parquet eignet sich ideal f\u00fcr die Abfrage einer Teilmenge von Spalten in einer mehrspaltigen Tabelle. Avro hingegen ist f\u00fcr ETL-Vorg\u00e4nge geeignet, bei denen wir alle Spalten abfragen.<\/li>\n<\/ol>\n<p><\/p>\n<h3>ORC im Vergleich zu Parquet<\/h3>\n<p><\/p>\n<ol>\n<li>Parquet speichert verschachtelte Daten besser.<\/li>\n<li>ORC ist besser geeignet f\u00fcr Predicate Pushdown.<\/li>\n<li>ORC unterst\u00fctzt ACID-Eigenschaften.<\/li>\n<li>ORC komprimiert Daten besser.<\/li>\n<\/ol>\n<p>\n<strong>Weitere Lesetipps zu diesem Thema<\/strong>:<\/p>\n<ol>\n<li><noindex><a rel=\"nofollow\" href=\"https:\/\/mcs.mail.ru\/blog\/analiz-bolshih-dannyh-v-oblake\">Datenanalyse in der Cloud: Wie Unternehmen datenorientiert werden k\u00f6nnen<\/a><\/noindex>.<\/li>\n<li><noindex><a rel=\"nofollow\" href=\"https:\/\/habr.com\/ru\/company\/mailru\/blog\/501598\/\">Ein bescheidenes Handbuch zu Datenbankschemas<\/a><\/noindex>.<\/li>\n<li><noindex><a rel=\"nofollow\" href=\"https:\/\/tele.click\/zavtra_oblachno\">Unser Telegram-Kanal \u00fcber digitale Transformation<\/a><\/noindex>. \n<\/li>\n<\/ol>\n<p>Quelle: <a content=\"nofollow\" rel=\"nofollow\" href=\"https:\/\/habr.com\/ru\/company\/mailru\/blog\/504952\/\">habr.com<\/a> <\/p>","protected":false,"gt_translate_keys":[{"key":"rendered","format":"html"}]},"excerpt":{"rendered":"<p>Weather Deity by Remarin \u041a\u043e\u043c\u0430\u043d\u0434\u0430 Mail.ru Cloud Solutions \u043f\u0440\u0435\u0434\u043b\u0430\u0433\u0430\u0435\u0442 \u043f\u0435\u0440\u0435\u0432\u043e\u0434 \u0441\u0442\u0430\u0442\u044c\u0438 \u0438\u043d\u0436\u0435\u043d\u0435\u0440\u0430 \u0420\u0430\u0445\u0443\u043b\u0430 \u0411\u0445\u0430\u0442\u0438\u0438 \u0438\u0437 \u043a\u043e\u043c\u043f\u0430\u043d\u0438\u0438 Clairvoyant \u043e \u0442\u043e\u043c, \u043a\u0430\u043a\u0438\u0435 \u0435\u0441\u0442\u044c \u0444\u043e\u0440\u043c\u0430\u0442\u044b \u0444\u0430\u0439\u043b\u043e\u0432 \u0432 \u0431\u043e\u043b\u044c\u0448\u0438\u0445 \u0434\u0430\u043d\u043d\u044b\u0445, \u043a\u0430\u043a\u0438\u0435 \u0441\u0430\u043c\u044b\u0435 \u0440\u0430\u0441\u043f\u0440\u043e\u0441\u0442\u0440\u0430\u043d\u0435\u043d\u043d\u044b\u0435 \u0444\u0443\u043d\u043a\u0446\u0438\u0438 \u0444\u043e\u0440\u043c\u0430\u0442\u043e\u0432 Hadoop \u0438 \u043a\u0430\u043a\u043e\u0439 \u0444\u043e\u0440\u043c\u0430\u0442 \u043b\u0443\u0447\u0448\u0435 \u0438\u0441\u043f\u043e\u043b\u044c\u0437\u043e\u0432\u0430\u0442\u044c. \u0417\u0430\u0447\u0435\u043c \u043d\u0443\u0436\u043d\u044b \u0440\u0430\u0437\u043d\u044b\u0435 \u0444\u043e\u0440\u043c\u0430\u0442\u044b \u0444\u0430\u0439\u043b\u043e\u0432 \u0421\u0435\u0440\u044c\u0435\u0437\u043d\u043e\u0435 \u0443\u0437\u043a\u043e\u0435 \u043c\u0435\u0441\u0442\u043e \u0432 \u043f\u0440\u043e\u0438\u0437\u0432\u043e\u0434\u0438\u0442\u0435\u043b\u044c\u043d\u043e\u0441\u0442\u0438 \u043f\u0440\u0438\u043b\u043e\u0436\u0435\u043d\u0438\u0439 \u0441 \u043f\u043e\u0434\u0434\u0435\u0440\u0436\u043a\u043e\u0439 HDFS, \u0442\u0430\u043a\u0438\u0445 \u043a\u0430\u043a MapReduce \u0438 [&hellip;]<\/p>\n","protected":false,"gt_translate_keys":[{"key":"rendered","format":"html"}]},"author":1,"featured_media":84417,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[688],"tags":[],"class_list":["post-84416","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-administrirovanie"],"aioseo_notices":[],"aioseo_head":"\n\t\t<!-- All in One SEO 4.9.10 - aioseo.com -->\n\t<meta name=\"description\" content=\"Weather Deity by Remarin \u041a\u043e\u043c\u0430\u043d\u0434\u0430 Mail.ru Cloud Solutions \u043f\u0440\u0435\u0434\u043b\u0430\u0433\u0430\u0435\u0442 \u043f\u0435\u0440\u0435\u0432\u043e\u0434 \u0441\u0442\u0430\u0442\u044c\u0438 \u0438\u043d\u0436\u0435\u043d\u0435\u0440\u0430 \u0420\u0430\u0445\u0443\u043b\u0430 \u0411\u0445\u0430\u0442\u0438\u0438 \u0438\u0437 \u043a\u043e\u043c\u043f\u0430\u043d\u0438\u0438 Clairvoyant \u043e \u0442\u043e\u043c, \u043a\u0430\u043a\u0438\u0435 \u0435\u0441\u0442\u044c \u0444\u043e\u0440\u043c\u0430\u0442\u044b \u0444\u0430\u0439\u043b\u043e\u0432 \u0432 \u0431\u043e\u043b\u044c\u0448\u0438\u0445 \u0434\u0430\u043d\u043d\u044b\u0445, \u043a\u0430\u043a\u0438\u0435 \u0441\u0430\u043c\u044b\u0435 \u0440\u0430\u0441\u043f\u0440\u043e\u0441\u0442\u0440\u0430\u043d\u0435\u043d\u043d\u044b\u0435 \u0444\u0443\u043d\u043a\u0446\u0438\u0438 \u0444\u043e\u0440\u043c\u0430\u0442\u043e\u0432 Hadoop \u0438 \u043a\u0430\u043a\u043e\u0439 \u0444\u043e\u0440\u043c\u0430\u0442 \u043b\u0443\u0447\u0448\u0435 \u0438\u0441\u043f\u043e\u043b\u044c\u0437\u043e\u0432\u0430\u0442\u044c. \u0417\u0430\u0447\u0435\u043c \u043d\u0443\u0436\u043d\u044b \u0440\u0430\u0437\u043d\u044b\u0435 \u0444\u043e\u0440\u043c\u0430\u0442\u044b \u0444\u0430\u0439\u043b\u043e\u0432 \u0421\u0435\u0440\u044c\u0435\u0437\u043d\u043e\u0435 \u0443\u0437\u043a\u043e\u0435 \u043c\u0435\u0441\u0442\u043e \u0432 \u043f\u0440\u043e\u0438\u0437\u0432\u043e\u0434\u0438\u0442\u0435\u043b\u044c\u043d\u043e\u0441\u0442\u0438 \u043f\u0440\u0438\u043b\u043e\u0436\u0435\u043d\u0438\u0439 \u0441 \u043f\u043e\u0434\u0434\u0435\u0440\u0436\u043a\u043e\u0439 HDFS, \u0442\u0430\u043a\u0438\u0445 \u043a\u0430\u043a MapReduce \u0438\" \/>\n\t<meta name=\"robots\" content=\"max-image-preview:large\" \/>\n\t<meta name=\"author\" content=\"Yuri Gagarin\"\/>\n\t<link rel=\"canonical\" href=\"https:\/\/prohoster.info\/de\/blog\/administrirovanie\/formaty-fajlov-v-bolshih-dannyh-kratkij-likbez\" \/>\n\t<meta name=\"generator\" content=\"All in One SEO (AIOSEO) 4.9.10\" \/>\n\t\t<meta property=\"og:locale\" content=\"de_DE\" \/>\n\t\t<meta property=\"og:site_name\" content=\"ProHoster | \u041a\u0443\u043f\u0438\u0442\u044c \u043d\u0430\u0434\u0435\u0436\u043d\u044b\u0439 \u0445\u043e\u0441\u0442\u0438\u043d\u0433 \u0434\u043b\u044f \u0441\u0430\u0439\u0442\u043e\u0432 \u0441 \u0437\u0430\u0449\u0438\u0442\u043e\u0439 \u043e\u0442 DDoS, VPS VDS \u0441\u0435\u0440\u0432\u0435\u0440\u044b\" \/>\n\t\t<meta property=\"og:type\" content=\"article\" \/>\n\t\t<meta property=\"og:title\" content=\"\ud83e\udd47\u0424\u043e\u0440\u043c\u0430\u0442\u044b \u0444\u0430\u0439\u043b\u043e\u0432 \u0432 \u0431\u043e\u043b\u044c\u0448\u0438\u0445 \u0434\u0430\u043d\u043d\u044b\u0445: \u043a\u0440\u0430\u0442\u043a\u0438\u0439 \u043b\u0438\u043a\u0431\u0435\u0437 | ProHoster\" \/>\n\t\t<meta property=\"og:description\" content=\"Weather Deity by Remarin \u041a\u043e\u043c\u0430\u043d\u0434\u0430 Mail.ru Cloud Solutions \u043f\u0440\u0435\u0434\u043b\u0430\u0433\u0430\u0435\u0442 \u043f\u0435\u0440\u0435\u0432\u043e\u0434 \u0441\u0442\u0430\u0442\u044c\u0438 \u0438\u043d\u0436\u0435\u043d\u0435\u0440\u0430 \u0420\u0430\u0445\u0443\u043b\u0430 \u0411\u0445\u0430\u0442\u0438\u0438 \u0438\u0437 \u043a\u043e\u043c\u043f\u0430\u043d\u0438\u0438 Clairvoyant \u043e \u0442\u043e\u043c, \u043a\u0430\u043a\u0438\u0435 \u0435\u0441\u0442\u044c \u0444\u043e\u0440\u043c\u0430\u0442\u044b \u0444\u0430\u0439\u043b\u043e\u0432 \u0432 \u0431\u043e\u043b\u044c\u0448\u0438\u0445 \u0434\u0430\u043d\u043d\u044b\u0445, \u043a\u0430\u043a\u0438\u0435 \u0441\u0430\u043c\u044b\u0435 \u0440\u0430\u0441\u043f\u0440\u043e\u0441\u0442\u0440\u0430\u043d\u0435\u043d\u043d\u044b\u0435 \u0444\u0443\u043d\u043a\u0446\u0438\u0438 \u0444\u043e\u0440\u043c\u0430\u0442\u043e\u0432 Hadoop \u0438 \u043a\u0430\u043a\u043e\u0439 \u0444\u043e\u0440\u043c\u0430\u0442 \u043b\u0443\u0447\u0448\u0435 \u0438\u0441\u043f\u043e\u043b\u044c\u0437\u043e\u0432\u0430\u0442\u044c. \u0417\u0430\u0447\u0435\u043c \u043d\u0443\u0436\u043d\u044b \u0440\u0430\u0437\u043d\u044b\u0435 \u0444\u043e\u0440\u043c\u0430\u0442\u044b \u0444\u0430\u0439\u043b\u043e\u0432 \u0421\u0435\u0440\u044c\u0435\u0437\u043d\u043e\u0435 \u0443\u0437\u043a\u043e\u0435 \u043c\u0435\u0441\u0442\u043e \u0432 \u043f\u0440\u043e\u0438\u0437\u0432\u043e\u0434\u0438\u0442\u0435\u043b\u044c\u043d\u043e\u0441\u0442\u0438 \u043f\u0440\u0438\u043b\u043e\u0436\u0435\u043d\u0438\u0439 \u0441 \u043f\u043e\u0434\u0434\u0435\u0440\u0436\u043a\u043e\u0439 HDFS, \u0442\u0430\u043a\u0438\u0445 \u043a\u0430\u043a MapReduce \u0438\" \/>\n\t\t<meta property=\"og:url\" content=\"https:\/\/prohoster.info\/de\/blog\/administrirovanie\/formaty-fajlov-v-bolshih-dannyh-kratkij-likbez\" \/>\n\t\t<meta property=\"og:image\" content=\"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg\" \/>\n\t\t<meta property=\"og:image:secure_url\" content=\"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg\" \/>\n\t\t<meta property=\"og:image:width\" content=\"350\" \/>\n\t\t<meta property=\"og:image:height\" content=\"350\" \/>\n\t\t<meta property=\"article:published_time\" content=\"2020-06-07T11:42:50+00:00\" \/>\n\t\t<meta property=\"article:modified_time\" content=\"2020-06-07T11:42:50+00:00\" \/>\n\t\t<meta property=\"article:publisher\" content=\"https:\/\/www.facebook.com\/prohoster\" \/>\n\t\t<meta property=\"article:author\" content=\"https:\/\/www.facebook.com\/prohoster\" \/>\n\t\t<!-- All in One SEO -->\n\n","aioseo_head_json":{"title":"\ud83e\udd47Dateiformate in Big Data: Ein kurzer \u00dcberblick | ProHoster","description":"Weather Deity von Remarin. Das Mail.ru Cloud Solutions Team bietet eine \u00dcbersetzung des Artikels von Ingenieur Rahul Bhatia von Clairvoyant an, der die verf\u00fcgbaren Dateiformate in Big Data, die g\u00e4ngigsten Funktionen der Hadoop-Formate und welches Format am besten verwendet werden sollte, behandelt. Warum sind verschiedene Dateiformate n\u00f6tig? Ein ernstes Engpassproblem bei der Leistung von HDFS-unterst\u00fctzten Anwendungen wie MapReduce ist...","canonical_url":"https:\/\/prohoster.info\/de\/blog\/administrirovanie\/formaty-fajlov-v-bolshih-dannyh-kratkij-likbez","robots":"max-image-preview:large","keywords":"","webmasterTools":{"miscellaneous":""},"schema":null,"og:locale":"de_DE","og:site_name":"ProHoster | \u041a\u0443\u043f\u0438\u0442\u044c \u043d\u0430\u0434\u0435\u0436\u043d\u044b\u0439 \u0445\u043e\u0441\u0442\u0438\u043d\u0433 \u0434\u043b\u044f \u0441\u0430\u0439\u0442\u043e\u0432 \u0441 \u0437\u0430\u0449\u0438\u0442\u043e\u0439 \u043e\u0442 DDoS, VPS VDS \u0441\u0435\u0440\u0432\u0435\u0440\u044b","og:type":"article","og:title":"\ud83e\udd47\u0424\u043e\u0440\u043c\u0430\u0442\u044b \u0444\u0430\u0439\u043b\u043e\u0432 \u0432 \u0431\u043e\u043b\u044c\u0448\u0438\u0445 \u0434\u0430\u043d\u043d\u044b\u0445: \u043a\u0440\u0430\u0442\u043a\u0438\u0439 \u043b\u0438\u043a\u0431\u0435\u0437 | ProHoster","og:description":"Weather Deity by Remarin \u041a\u043e\u043c\u0430\u043d\u0434\u0430 Mail.ru Cloud Solutions \u043f\u0440\u0435\u0434\u043b\u0430\u0433\u0430\u0435\u0442 \u043f\u0435\u0440\u0435\u0432\u043e\u0434 \u0441\u0442\u0430\u0442\u044c\u0438 \u0438\u043d\u0436\u0435\u043d\u0435\u0440\u0430 \u0420\u0430\u0445\u0443\u043b\u0430 \u0411\u0445\u0430\u0442\u0438\u0438 \u0438\u0437 \u043a\u043e\u043c\u043f\u0430\u043d\u0438\u0438 Clairvoyant \u043e \u0442\u043e\u043c, \u043a\u0430\u043a\u0438\u0435 \u0435\u0441\u0442\u044c \u0444\u043e\u0440\u043c\u0430\u0442\u044b \u0444\u0430\u0439\u043b\u043e\u0432 \u0432 \u0431\u043e\u043b\u044c\u0448\u0438\u0445 \u0434\u0430\u043d\u043d\u044b\u0445, \u043a\u0430\u043a\u0438\u0435 \u0441\u0430\u043c\u044b\u0435 \u0440\u0430\u0441\u043f\u0440\u043e\u0441\u0442\u0440\u0430\u043d\u0435\u043d\u043d\u044b\u0435 \u0444\u0443\u043d\u043a\u0446\u0438\u0438 \u0444\u043e\u0440\u043c\u0430\u0442\u043e\u0432 Hadoop \u0438 \u043a\u0430\u043a\u043e\u0439 \u0444\u043e\u0440\u043c\u0430\u0442 \u043b\u0443\u0447\u0448\u0435 \u0438\u0441\u043f\u043e\u043b\u044c\u0437\u043e\u0432\u0430\u0442\u044c. \u0417\u0430\u0447\u0435\u043c \u043d\u0443\u0436\u043d\u044b \u0440\u0430\u0437\u043d\u044b\u0435 \u0444\u043e\u0440\u043c\u0430\u0442\u044b \u0444\u0430\u0439\u043b\u043e\u0432 \u0421\u0435\u0440\u044c\u0435\u0437\u043d\u043e\u0435 \u0443\u0437\u043a\u043e\u0435 \u043c\u0435\u0441\u0442\u043e \u0432 \u043f\u0440\u043e\u0438\u0437\u0432\u043e\u0434\u0438\u0442\u0435\u043b\u044c\u043d\u043e\u0441\u0442\u0438 \u043f\u0440\u0438\u043b\u043e\u0436\u0435\u043d\u0438\u0439 \u0441 \u043f\u043e\u0434\u0434\u0435\u0440\u0436\u043a\u043e\u0439 HDFS, \u0442\u0430\u043a\u0438\u0445 \u043a\u0430\u043a MapReduce \u0438","og:url":"https:\/\/prohoster.info\/de\/blog\/administrirovanie\/formaty-fajlov-v-bolshih-dannyh-kratkij-likbez","og:image":"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg","og:image:secure_url":"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg","og:image:width":350,"og:image:height":350,"article:published_time":"2020-06-07T11:42:50+00:00","article:modified_time":"2020-06-07T11:42:50+00:00","article:publisher":"https:\/\/www.facebook.com\/prohoster","article:author":"https:\/\/www.facebook.com\/prohoster"},"aioseo_meta_data":{"post_id":"84416","title":null,"description":null,"keywords":null,"keyphrases":null,"primary_term":null,"canonical_url":null,"og_title":null,"og_description":null,"og_object_type":"default","og_image_type":"default","og_image_url":null,"og_image_width":null,"og_image_height":null,"og_image_custom_url":null,"og_image_custom_fields":null,"og_video":null,"og_custom_url":null,"og_article_section":null,"og_article_tags":null,"twitter_use_og":false,"twitter_card":"default","twitter_image_type":"default","twitter_image_url":null,"twitter_image_custom_url":null,"twitter_image_custom_fields":null,"twitter_title":null,"twitter_description":null,"schema":{"blockGraphs":[],"customGraphs":[],"default":{"data":{"Article":[],"Course":[],"Dataset":[],"FAQPage":[],"Movie":[],"Person":[],"Product":[],"ProductReview":[],"Car":[],"Recipe":[],"Service":[],"SoftwareApplication":[],"WebPage":[]},"graphName":"","isEnabled":true},"graphs":[]},"schema_type":null,"schema_type_options":null,"pillar_content":false,"robots_default":true,"robots_noindex":false,"robots_noarchive":false,"robots_nosnippet":false,"robots_nofollow":false,"robots_noimageindex":false,"robots_noodp":false,"robots_notranslate":false,"robots_max_snippet":null,"robots_max_videopreview":null,"robots_max_imagepreview":"large","priority":null,"frequency":null,"local_seo":null,"seo_analyzer_scan_date":null,"breadcrumb_settings":null,"limit_modified_date":false,"reviewed_by":null,"ai":null,"created":"2021-02-28 14:58:40","updated":"2022-09-28 08:24:46"},"gt_translate_keys":[{"key":"link","format":"url"}],"_links":{"self":[{"href":"https:\/\/prohoster.info\/de\/wp-json\/wp\/v2\/posts\/84416","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/prohoster.info\/de\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/prohoster.info\/de\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/prohoster.info\/de\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/prohoster.info\/de\/wp-json\/wp\/v2\/comments?post=84416"}],"version-history":[{"count":0,"href":"https:\/\/prohoster.info\/de\/wp-json\/wp\/v2\/posts\/84416\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/prohoster.info\/de\/wp-json\/wp\/v2\/media\/84417"}],"wp:attachment":[{"href":"https:\/\/prohoster.info\/de\/wp-json\/wp\/v2\/media?parent=84416"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/prohoster.info\/de\/wp-json\/wp\/v2\/categories?post=84416"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/prohoster.info\/de\/wp-json\/wp\/v2\/tags?post=84416"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}