{"id":84416,"date":"2020-06-07T13:42:50","date_gmt":"2020-06-07T11:42:50","guid":{"rendered":"https:\/\/prohoster.info\/blog\/administrirovanie\/formaty-fajlov-v-bolshih-dannyh-kratkij-likbez"},"modified":"2020-06-07T13:42:50","modified_gmt":"2020-06-07T11:42:50","slug":"formaty-fajlov-v-bolshih-dannyh-kratkij-likbez","status":"publish","type":"post","link":"https:\/\/prohoster.info\/de\/blog\/administrirovanie\/formaty-fajlov-v-bolshih-dannyh-kratkij-likbez","title":{"rendered":"Dateiformate in Big Data: Ein kurzer \u00dcberblick","gt_translate_keys":[{"key":"rendered","format":"text"}]},"content":{"rendered":"<p><img decoding=\"async\" alt=\"Dateiformate in Big Data: Ein kurzer \u00dcberblick\" src=\"\/wp-content\/uploads\/2020\/06\/c909979e0474bc6a1f7234cd88167220.png\" style=\"display:block;margin: 0 auto;\" \/><br \/>\n<noindex><a rel=\"nofollow\" href=\"https:\/\/www.deviantart.com\/remarin\/art\/Weather-Deity-743892889\"><i>Wettergott von Remarin<\/i><\/a><\/noindex> <\/p>\n<p>Team <noindex><a rel=\"nofollow\" href=\"https:\/\/mcs.mail.ru\/\">Mail.ru Cloud Solutions<\/a><\/noindex> bietet <noindex><a rel=\"nofollow\" href=\"https:\/\/blog.clairvoyantsoft.com\/big-data-file-formats-3fb659903271\">\u00dcbersetzung des Artikels<\/a><\/noindex> von Ingenieur Rahul Bhatia von Clairvoyant \u00fcber die verschiedenen Dateiformate in Big Data, welche die h\u00e4ufigsten Funktionen von Hadoop-Formaten sind und welches Format am besten verwendet werden sollte.<br \/>\n<noindex><a rel=\"nofollow\" name=\"habracut\"><\/a><\/noindex><\/p>\n<h2>Warum sind verschiedene Dateiformate notwendig<\/h2>\n<p>\nEin ernsthaftes Engpassproblem bei der Leistung von Anwendungen, die HDFS unterst\u00fctzen, wie MapReduce und Spark, ist die Zeit f\u00fcr die Suche, das Lesen und das Schreiben von Daten. Diese Probleme werden durch die Schwierigkeiten beim Management gro\u00dfer Datens\u00e4tze versch\u00e4rft, wenn wir nicht \u00fcber ein festgelegtes, sondern ein sich weiterentwickelndes Schema verf\u00fcgen oder wenn Einschr\u00e4nkungen f\u00fcr die Speicherung bestehen.<\/p>\n<p>Die Verarbeitung gro\u00dfer Datenmengen erh\u00f6ht die Belastung des Speichersystems \u2013 Hadoop speichert Daten redundant, um Fehlertoleranz zu erreichen. Neben Festplatten werden auch Prozessor, Netzwerk, Ein- und Ausgabesystem usw. belastet. Mit dem Wachstum des Datenvolumens steigen auch die Kosten f\u00fcr deren Verarbeitung und Speicherung.<\/p>\n<p>Verschiedene Dateiformate in <noindex><a rel=\"nofollow\" href=\"https:\/\/mcs.mail.ru\/blog\/zachem-nuzhen-hadoop\">Hadoop<\/a><\/noindex> wurden entwickelt, um genau diese Probleme zu l\u00f6sen. Die Wahl des geeigneten Dateiformats kann erhebliche Vorteile bringen:<\/p>\n<ol>\n<li>Schnelleres Lesezeiten.<\/li>\n<li>Schnelleres Schreibzeiten.<\/li>\n<li>Teilbare Dateien.<\/li>\n<li>Unterst\u00fctzung der Schema-Evolution.<\/li>\n<li>Erweiterte Unterst\u00fctzung von Kompression.<\/li>\n<\/ol>\n<p>\nEinige Dateiformate sind f\u00fcr allgemeine Zwecke gedacht, andere f\u00fcr spezifischere Anwendungen, und einige wurden unter Ber\u00fccksichtigung bestimmter Dateneigenschaften entwickelt. Daher gibt es tats\u00e4chlich eine gro\u00dfe Auswahl.<\/p>\n<h2>Das Avro-Dateiformat<\/h2>\n<p>\nF\u00fcr <i>zur Datenspeicherung <\/i>wird weit verbreitet eingesetzt \u2013 Avro ist ein <i>zeichenbasierter<\/i>Datenspeicherformat in Hadoop. Es speichert das Schema im JSON-Format, was das Lesen und Interpretieren durch jedes Programm erleichtert. Die Daten selbst liegen im bin\u00e4ren Format vor, kompakt und effizient.<\/p>\n<p>Das Avro-Serialisierungssystem ist sprachneutral. Dateien k\u00f6nnen in verschiedenen Sprachen verarbeitet werden, derzeit sind dies C, C++, C#, Java, Python und Ruby.<\/p>\n<p>Ein zentrales Merkmal von Avro ist die zuverl\u00e4ssige Unterst\u00fctzung von Datenschemas, die sich im Laufe der Zeit \u00e4ndern, d.h. weiterentwickeln. Avro erkennt Schema\u00e4nderungen \u2013 das L\u00f6schen, Hinzuf\u00fcgen oder \u00c4ndern von Feldern.<\/p>\n<p>Avro unterst\u00fctzt eine Vielzahl von Datenstrukturen. Zum Beispiel kann man einen Datensatz erstellen, der ein Array, einen Aufz\u00e4hlungstyp und einen Unterdatensatz enth\u00e4lt.<\/p>\n<p><img decoding=\"async\" alt=\"Dateiformate in Big Data: Ein kurzer \u00dcberblick\" src=\"\/wp-content\/uploads\/2020\/06\/9bf044329ac0980a48a125c505dee265.png\" style=\"display:block;margin: 0 auto;\" \/><br \/>\nDieses Format eignet sich perfekt zum Schreiben in die Landing Zone des Data Lakes (<noindex><a rel=\"nofollow\" href=\"https:\/\/mcs.mail.ru\/blog\/chto-takoe-ozera-dannyh-i-zachem-tam-hranyat-big-data\">Data Lake<\/a><\/noindex>, oder Data Lake \u2013 eine Sammlung von Instanzen zur Speicherung verschiedener Datentypen zus\u00e4tzlich zu den Datenquellen selbst). <\/p>\n<p>Also, f\u00fcr das Schreiben in die Landing Zone eines Data Lakes ist dieses Format aus folgenden Gr\u00fcnden am besten geeignet:<\/p>\n<ol>\n<li>Daten aus dieser Zone werden normalerweise vollst\u00e4ndig gelesen, um von nachgelagerten Systemen verarbeitet zu werden \u2013 und der zeilenbasierte Format ist in diesem Fall effizienter.<\/li>\n<li>Nachgelagerte Systeme k\u00f6nnen Tabellenschemata problemlos aus Dateien extrahieren \u2013 es ist nicht notwendig, Schemata separat in einem externen Metaspeicher zu speichern.<\/li>\n<li>Jede \u00c4nderung im urspr\u00fcnglichen Schema wird leicht verarbeitet (Schema-Evolution).<\/li>\n<\/ol>\n<p><\/p>\n<h2>Das Parquet-Dateiformat<\/h2>\n<p>\nParquet ist ein Open-Source-Dateiformat f\u00fcr Hadoop, das <i>verschachtelte Datenstrukturen in einem flachen Spaltenformat speichert.<\/i>.<\/p>\n<p>Im Vergleich zu einem traditionellen zeilenbasierten Ansatz ist Parquet hinsichtlich Speicherung und Leistung effizienter.<\/p>\n<p>Dies ist besonders n\u00fctzlich f\u00fcr Abfragen, die bestimmte Spalten aus einer breiten (mit vielen Spalten) Tabelle lesen. Dank des Dateiformats werden nur die ben\u00f6tigten Spalten gelesen, wodurch Ein- und Ausgaben minimiert werden.<\/p>\n<p><strong>Eine kleine Erkl\u00e4rung<\/strong>: Um das Parquet-Dateiformat in Hadoop besser zu verstehen, lassen Sie uns betrachten, was ein spaltenbasierter \u2013 also ein spaltenorientierter \u2013 Format ist. In einem solchen Format werden gleichartige Werte jeder Spalte zusammen gespeichert. <\/p>\n<p><noindex><a rel=\"nofollow\" href=\"http:\/\/netjs.blogspot.com\/\">Zum Beispiel<\/a><\/noindex>, der Datensatz umfasst die Felder ID, Name und Abteilung. In diesem Fall werden alle Werte der Spalte ID zusammen gespeichert, ebenso wie die Werte der Spalte Name und so weiter. Die Tabelle w\u00fcrde folgenderma\u00dfen aussehen:<\/p>\n<p><strong>ID<\/strong><br \/>\n<strong>Name<\/strong><br \/>\n<strong>Abteilung<\/strong><\/p>\n<p>1<br \/>\nemp1<br \/>\nd1<\/p>\n<p>2<br \/>\nemp2<br \/>\nd2<\/p>\n<p>3<br \/>\nemp3<br \/>\nd3<\/p>\n<p>\nIm zeilenbasierten Format werden die Daten wie folgt gespeichert:<\/p>\n<p>1<br \/>\nemp1<br \/>\nd1<br \/>\n2<br \/>\nemp2<br \/>\nd2<br \/>\n3<br \/>\nemp3<br \/>\nd3<\/p>\n<p>\nIm spaltenbasierten Format werden dieselben Daten so gespeichert:<\/p>\n<p>1<br \/>\n2<br \/>\n3<br \/>\nemp1<br \/>\nemp2<br \/>\nemp3<br \/>\nd1<br \/>\nd2<br \/>\nd3<\/p>\n<p>\nDas spaltenbasierte Format ist effizienter, wenn Sie aus einer Tabelle mehrere Spalten abfragen m\u00fcssen. Es werden nur die erforderlichen Spalten gelesen, da sie nebeneinander liegen. Dadurch werden Ein- und Ausgaben minimiert.<\/p>\n<p>Zum Beispiel ben\u00f6tigen Sie nur die Spalte NAME. Im<noindex><a rel=\"nofollow\" href=\"http:\/\/netjs.blogspot.com\/\"> zeilenbasierten Format<\/a><\/noindex> Jeder Datensatz im Datensatz muss geladen, in Felder zerlegt und dann die Daten NAME extrahiert werden. Das spaltenbasierte Format erm\u00f6glicht den direkten Zugriff auf die Spalte Name, da alle Werte f\u00fcr diese Spalte zusammen gespeichert werden. Ein Scannen des gesamten Datensatzes ist nicht erforderlich.<\/p>\n<p>Somit verbessert das spaltenbasierte Format die Abfrageleistung, da weniger Suchzeit ben\u00f6tigt wird, um zu den erforderlichen Spalten zu gelangen, und die Anzahl der Lese- und Schreibvorg\u00e4nge reduziert wird, da nur die ben\u00f6tigten Spalten gelesen werden.<\/p>\n<p>Eine der einzigartigen Eigenschaften<noindex><a rel=\"nofollow\" href=\"http:\/\/netjs.blogspot.com\/\"> Parquet<\/a><\/noindex> besteht darin, dass es in diesem Format <i>Daten mit verschachtelten Strukturen<\/i>speichern kann. Das bedeutet, dass in einer Parquet-Datei sogar verschachtelte Felder einzeln gelesen werden k\u00f6nnen, ohne dass alle Felder der verschachtelten Struktur gelesen werden m\u00fcssen. F\u00fcr die Speicherung von verschachtelten Strukturen verwendet Parquet den Algorithmus f\u00fcr Zerlegung und Zusammenstellung (shredding and assembly).<\/p>\n<p><img decoding=\"async\" alt=\"Dateiformate in Big Data: Ein kurzer \u00dcberblick\" src=\"\/wp-content\/uploads\/2020\/06\/8cba9a4faccc4bac7c5bbc3eec163a3c.png\" style=\"display:block;margin: 0 auto;\" \/><br \/>\nUm das Parquet-Dateiformat in Hadoop zu verstehen, m\u00fcssen die folgenden Begriffe bekannt sein:<\/p>\n<ol>\n<li><strong>Row Group<\/strong> (row group): logische horizontale Aufteilung der Daten in Zeilen. Eine Row Group besteht aus einem Fragment jeder Spalte im Datensatz.<\/li>\n<li><strong>Column Chunk<\/strong> (column chunk): Fragment einer bestimmten Spalte. Diese Spaltenfragmente befinden sich in einer bestimmten Row Group und werden im Datei garantiert benachbart sein.<\/li>\n<li><strong>Seite<\/strong> (page): Spaltenfragmente werden in aufeinanderfolgende Seiten unterteilt. Seiten haben einen gemeinsamen Header, sodass beim Lesen unn\u00f6tige \u00fcbersprungen werden k\u00f6nnen.<\/li>\n<\/ol>\n<p>\n<img decoding=\"async\" alt=\"Dateiformate in Big Data: Ein kurzer \u00dcberblick\" src=\"\/wp-content\/uploads\/2020\/06\/0f3d583bc2f07b6fef8430f10433cc14.png\" style=\"display:block;margin: 0 auto;\" \/><br \/>\nHier enth\u00e4lt der Header einfach eine magische Zahl <i>PAR1<\/i> (4 Bytes), die die Datei als Datei im Parquet-Format identifiziert.<\/p>\n<p>Im Footer ist Folgendes aufgezeichnet:<\/p>\n<ol>\n<li>Metadaten der Datei, die die Startkoordinaten der Metadaten jeder Spalte enthalten. Beim Lesen m\u00fcssen zun\u00e4chst die Metadaten der Datei gelesen werden, um alle interessierenden Spaltenfragmente zu finden. Danach sollten die Spaltenfragmente nacheinander gelesen werden. Die Metadaten umfassen au\u00dferdem die Versionsnummer des Formats, das Schema und alle zus\u00e4tzlichen Schl\u00fcssel-Wert-Paare.<\/li>\n<li>L\u00e4nge der Metadaten (4 Bytes).<\/li>\n<li>Magische Zahl <i>PAR1<\/i> (4 Bytes).<\/li>\n<\/ol>\n<p><\/p>\n<h2>Das ORC-Dateiformat<\/h2>\n<p>\n<i>Optimiertes zeilen- und spaltenbasiertes Dateiformat<\/i> (Optimized Row Columnar, <noindex><a rel=\"nofollow\" href=\"https:\/\/orc.apache.org\/\">ORC<\/a><\/noindex>) bietet eine sehr effiziente Methode zur Datenspeicherung und wurde entwickelt, um die Einschr\u00e4nkungen anderer Formate zu \u00fcberwinden. Es speichert Daten in einer perfekt kompakten Form und erm\u00f6glicht das \u00dcberspringen unn\u00f6tiger Details, ohne dass gro\u00dfe, komplexe oder manuell wartbare Indizes erforderlich sind. <\/p>\n<p>Vorteile des ORC-Formats:<\/p>\n<ol>\n<li>Eine Datei pro Aufgabe, was die Belastung des NameNode (Master-Node) verringert.<\/li>\n<li>Unterst\u00fctzung von Hive-Datentypen, einschlie\u00dflich DateTime, Dezimal- und komplexen Datentypen (struct, list, map und union).<\/li>\n<li>Gleichzeitige Lesung derselben Datei durch verschiedene Prozesse des RecordReaders.<\/li>\n<li>M\u00f6glichkeit der Dateiteilung ohne das Scannen nach Markierungen.<\/li>\n<li>Sch\u00e4tzung des maximalen Heap-Speicherplatzes f\u00fcr Lese-\/Schreibprozesse anhand der Informationen im Datei-Footer.<\/li>\n<li>Metadaten werden im bin\u00e4ren Format der Serialisierung von Protocol Buffers gespeichert, wodurch das Hinzuf\u00fcgen und L\u00f6schen von Feldern m\u00f6glich ist.<\/li>\n<\/ol>\n<p>\n<img decoding=\"async\" alt=\"Dateiformate in Big Data: Ein kurzer \u00dcberblick\" src=\"\/wp-content\/uploads\/2020\/06\/342a51df1730398d5280484407461d8c.png\" style=\"display:block;margin: 0 auto;\" \/><br \/>\nORC speichert Sammlungen von Zeilen in einer Datei, wobei innerhalb der Sammlung die Zeilendaten in einem Spaltenformat gespeichert werden.<\/p>\n<p>Die ORC-Datei speichert Gruppen von Zeilen, die als Streifen (stripes) bezeichnet werden, und zus\u00e4tzliche Informationen im Fu\u00dfbereich der Datei. Der Postscript am Ende der Datei enth\u00e4lt Komprimierungsparameter und die Gr\u00f6\u00dfe des komprimierten Fu\u00dfbereichs.<\/p>\n<p>Der Standardstreifen hat eine Gr\u00f6\u00dfe von 250 MB. Dank der gro\u00dfen Streifen wird das Lesen von HDFS effizienter, da gro\u00dfe zusammenh\u00e4ngende Bl\u00f6cke gelesen werden.<\/p>\n<p>Im Fu\u00dfbereich der Datei ist eine Liste der Streifen in der Datei, die Anzahl der Zeilen pro Streifen und der Datentyp jeder Spalte aufgezeichnet. Dort sind auch die resultierenden Werte f\u00fcr count, min, max und sum f\u00fcr jede Spalte gespeichert.<\/p>\n<p>Der Fu\u00dfbereich des Streifens enth\u00e4lt ein Verzeichnis der Standortstr\u00f6me.<\/p>\n<p>Zeilendaten werden beim Scannen von Tabellen verwendet.<\/p>\n<p>Indizes umfassen minimale und maximale Werte f\u00fcr jede Spalte sowie die Positionen der Zeilen in jeder Spalte. ORC-Indizes werden nur zur Auswahl von Streifen und Gruppen von Zeilen verwendet und nicht zur Beantwortung von Anfragen.<\/p>\n<h2>Vergleich verschiedener Dateiformate<\/h2>\n<p><\/p>\n<h3>Avro im Vergleich zu Parquet<\/h3>\n<p><\/p>\n<ol>\n<li>Avro ist ein zeilenbasiertes Speicherformat, w\u00e4hrend Parquet Daten spaltenbasiert speichert.<\/li>\n<li>Parquet eignet sich besser f\u00fcr analytische Abfragen, das hei\u00dft, Leseoperationen und Datenabfragen sind viel effizienter als Schreiboperationen.<\/li>\n<li>Schreiboperationen in Avro werden effizienter durchgef\u00fchrt als in Parquet.<\/li>\n<li>Avro funktioniert reifer mit der Weiterentwicklung von Schemata. Parquet unterst\u00fctzt nur das Hinzuf\u00fcgen von Schemata, w\u00e4hrend Avro eine multifunktionale Evolution implementiert, das hei\u00dft, das Hinzuf\u00fcgen oder \u00c4ndern von Spalten.<\/li>\n<li>Parquet eignet sich hervorragend f\u00fcr Anfragen zu Teilmengen von Spalten in einer mehrspaltigen Tabelle. Avro ist geeignet f\u00fcr ETL-Vorg\u00e4nge, bei denen wir alle Spalten anfragen.<\/li>\n<\/ol>\n<p><\/p>\n<h3>ORC im Vergleich zu Parquet<\/h3>\n<p><\/p>\n<ol>\n<li>Parquet speichert verschachtelte Daten besser.<\/li>\n<li>ORC ist besser an das Pushdown von Pr\u00e4dikaten angepasst.<\/li>\n<li>ORC unterst\u00fctzt ACID-Eigenschaften.<\/li>\n<li>ORC komprimiert Daten besser.<\/li>\n<\/ol>\n<p>\n<strong>Was gibt es noch zu lesen<\/strong>:<\/p>\n<ol>\n<li><noindex><a rel=\"nofollow\" href=\"https:\/\/mcs.mail.ru\/blog\/analiz-bolshih-dannyh-v-oblake\">Analyse gro\u00dfer Datenmengen in der Cloud: Wie Unternehmen datengest\u00fctzt werden k\u00f6nnen<\/a><\/noindex>.<\/li>\n<li><noindex><a rel=\"nofollow\" href=\"https:\/\/habr.com\/ru\/company\/mailru\/blog\/501598\/\">Ein bescheidenes Handbuch zu Datenbankschemata<\/a><\/noindex>.<\/li>\n<li><noindex><a rel=\"nofollow\" href=\"https:\/\/tele.click\/zavtra_oblachno\">Unser Telegram-Kanal \u00fcber digitale Transformation<\/a><\/noindex>. \n<\/li>\n<\/ol>\n<p>Quelle: <a content=\"nofollow\" rel=\"nofollow\" href=\"https:\/\/habr.com\/ru\/company\/mailru\/blog\/504952\/\">habr.com<\/a> <\/p>","protected":false,"gt_translate_keys":[{"key":"rendered","format":"html"}]},"excerpt":{"rendered":"<p>Weather Deity by Remarin \u041a\u043e\u043c\u0430\u043d\u0434\u0430 Mail.ru Cloud Solutions \u043f\u0440\u0435\u0434\u043b\u0430\u0433\u0430\u0435\u0442 \u043f\u0435\u0440\u0435\u0432\u043e\u0434 \u0441\u0442\u0430\u0442\u044c\u0438 \u0438\u043d\u0436\u0435\u043d\u0435\u0440\u0430 \u0420\u0430\u0445\u0443\u043b\u0430 \u0411\u0445\u0430\u0442\u0438\u0438 \u0438\u0437 \u043a\u043e\u043c\u043f\u0430\u043d\u0438\u0438 Clairvoyant \u043e \u0442\u043e\u043c, \u043a\u0430\u043a\u0438\u0435 \u0435\u0441\u0442\u044c \u0444\u043e\u0440\u043c\u0430\u0442\u044b \u0444\u0430\u0439\u043b\u043e\u0432 \u0432 \u0431\u043e\u043b\u044c\u0448\u0438\u0445 \u0434\u0430\u043d\u043d\u044b\u0445, \u043a\u0430\u043a\u0438\u0435 \u0441\u0430\u043c\u044b\u0435 \u0440\u0430\u0441\u043f\u0440\u043e\u0441\u0442\u0440\u0430\u043d\u0435\u043d\u043d\u044b\u0435 \u0444\u0443\u043d\u043a\u0446\u0438\u0438 \u0444\u043e\u0440\u043c\u0430\u0442\u043e\u0432 Hadoop \u0438 \u043a\u0430\u043a\u043e\u0439 \u0444\u043e\u0440\u043c\u0430\u0442 \u043b\u0443\u0447\u0448\u0435 \u0438\u0441\u043f\u043e\u043b\u044c\u0437\u043e\u0432\u0430\u0442\u044c. \u0417\u0430\u0447\u0435\u043c \u043d\u0443\u0436\u043d\u044b \u0440\u0430\u0437\u043d\u044b\u0435 \u0444\u043e\u0440\u043c\u0430\u0442\u044b \u0444\u0430\u0439\u043b\u043e\u0432 \u0421\u0435\u0440\u044c\u0435\u0437\u043d\u043e\u0435 \u0443\u0437\u043a\u043e\u0435 \u043c\u0435\u0441\u0442\u043e \u0432 \u043f\u0440\u043e\u0438\u0437\u0432\u043e\u0434\u0438\u0442\u0435\u043b\u044c\u043d\u043e\u0441\u0442\u0438 \u043f\u0440\u0438\u043b\u043e\u0436\u0435\u043d\u0438\u0439 \u0441 \u043f\u043e\u0434\u0434\u0435\u0440\u0436\u043a\u043e\u0439 HDFS, \u0442\u0430\u043a\u0438\u0445 \u043a\u0430\u043a MapReduce \u0438 [&hellip;]<\/p>\n","protected":false,"gt_translate_keys":[{"key":"rendered","format":"html"}]},"author":1,"featured_media":84417,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[688],"tags":[],"class_list":["post-84416","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-administrirovanie"],"aioseo_notices":[],"aioseo_head":"\n\t\t<!-- All in One SEO 5.0.1.1 - aioseo.com -->\n\t<meta name=\"robots\" content=\"max-image-preview:large\" \/>\n\t<meta name=\"author\" content=\"Yuri Gagarin\"\/>\n\t<link rel=\"canonical\" href=\"https:\/\/prohoster.info\/de\/blog\/administrirovanie\/formaty-fajlov-v-bolshih-dannyh-kratkij-likbez\" \/>\n\t<meta name=\"generator\" content=\"All in One SEO (AIOSEO) 5.0.1.1\" \/>\n\t\t<meta property=\"og:locale\" content=\"de_DE\" \/>\n\t\t<meta property=\"og:site_name\" content=\"ProHoster | \u041a\u0443\u043f\u0438\u0442\u044c \u043d\u0430\u0434\u0435\u0436\u043d\u044b\u0439 \u0445\u043e\u0441\u0442\u0438\u043d\u0433 \u0434\u043b\u044f \u0441\u0430\u0439\u0442\u043e\u0432 \u0441 \u0437\u0430\u0449\u0438\u0442\u043e\u0439 \u043e\u0442 DDoS, VPS VDS \u0441\u0435\u0440\u0432\u0435\u0440\u044b\" \/>\n\t\t<meta property=\"og:type\" content=\"article\" \/>\n\t\t<meta property=\"og:title\" content=\"\ud83e\udd47\u0424\u043e\u0440\u043c\u0430\u0442\u044b \u0444\u0430\u0439\u043b\u043e\u0432 \u0432 \u0431\u043e\u043b\u044c\u0448\u0438\u0445 \u0434\u0430\u043d\u043d\u044b\u0445: \u043a\u0440\u0430\u0442\u043a\u0438\u0439 \u043b\u0438\u043a\u0431\u0435\u0437 | ProHoster\" \/>\n\t\t<meta property=\"og:url\" content=\"https:\/\/prohoster.info\/de\/blog\/administrirovanie\/formaty-fajlov-v-bolshih-dannyh-kratkij-likbez\" \/>\n\t\t<meta property=\"og:image\" content=\"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg\" \/>\n\t\t<meta property=\"og:image:secure_url\" content=\"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg\" \/>\n\t\t<meta property=\"og:image:width\" content=\"350\" \/>\n\t\t<meta property=\"og:image:height\" content=\"350\" \/>\n\t\t<meta property=\"article:published_time\" content=\"2020-06-07T11:42:50+00:00\" \/>\n\t\t<meta property=\"article:modified_time\" content=\"2020-06-07T11:42:50+00:00\" \/>\n\t\t<meta property=\"article:publisher\" content=\"https:\/\/www.facebook.com\/prohoster\" \/>\n\t\t<meta property=\"article:author\" content=\"https:\/\/www.facebook.com\/prohoster\" \/>\n\t\t<!-- All in One SEO -->\n\n","aioseo_head_json":{"title":"\ud83e\udd47Dateiformate in Big Data: ein kurzer \u00dcberblick | ProHoster","description":"","canonical_url":"https:\/\/prohoster.info\/de\/blog\/administrirovanie\/formaty-fajlov-v-bolshih-dannyh-kratkij-likbez","robots":"max-image-preview:large","keywords":"","webmasterTools":{"miscellaneous":""},"schema":null,"og:locale":"de_DE","og:site_name":"ProHoster | \u041a\u0443\u043f\u0438\u0442\u044c \u043d\u0430\u0434\u0435\u0436\u043d\u044b\u0439 \u0445\u043e\u0441\u0442\u0438\u043d\u0433 \u0434\u043b\u044f \u0441\u0430\u0439\u0442\u043e\u0432 \u0441 \u0437\u0430\u0449\u0438\u0442\u043e\u0439 \u043e\u0442 DDoS, VPS VDS \u0441\u0435\u0440\u0432\u0435\u0440\u044b","og:type":"article","og:title":"\ud83e\udd47\u0424\u043e\u0440\u043c\u0430\u0442\u044b \u0444\u0430\u0439\u043b\u043e\u0432 \u0432 \u0431\u043e\u043b\u044c\u0448\u0438\u0445 \u0434\u0430\u043d\u043d\u044b\u0445: \u043a\u0440\u0430\u0442\u043a\u0438\u0439 \u043b\u0438\u043a\u0431\u0435\u0437 | ProHoster","og:url":"https:\/\/prohoster.info\/de\/blog\/administrirovanie\/formaty-fajlov-v-bolshih-dannyh-kratkij-likbez","og:image":"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg","og:image:secure_url":"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg","og:image:width":350,"og:image:height":350,"article:published_time":"2020-06-07T11:42:50+00:00","article:modified_time":"2020-06-07T11:42:50+00:00","article:publisher":"https:\/\/www.facebook.com\/prohoster","article:author":"https:\/\/www.facebook.com\/prohoster"},"aioseo_meta_data":{"post_id":"84416","title":null,"description":null,"keywords":null,"keyphrases":null,"primary_term":null,"canonical_url":null,"og_title":null,"og_description":null,"og_object_type":"default","og_image_type":"default","og_image_url":null,"og_image_width":null,"og_image_height":null,"og_image_custom_url":null,"og_image_custom_fields":null,"og_video":null,"og_custom_url":null,"og_article_section":null,"og_article_tags":null,"twitter_use_og":false,"twitter_card":"default","twitter_image_type":"default","twitter_image_url":null,"twitter_image_custom_url":null,"twitter_image_custom_fields":null,"twitter_title":null,"twitter_description":null,"schema":{"blockGraphs":[],"customGraphs":[],"default":{"data":{"Article":[],"Course":[],"Dataset":[],"FAQPage":[],"Movie":[],"Person":[],"Product":[],"ProductReview":[],"Car":[],"Recipe":[],"Service":[],"SoftwareApplication":[],"WebPage":[]},"graphName":"","isEnabled":true},"graphs":[]},"schema_type":null,"schema_type_options":null,"pillar_content":false,"robots_default":true,"robots_noindex":false,"robots_noarchive":false,"robots_nosnippet":false,"robots_nofollow":false,"robots_noimageindex":false,"robots_noodp":false,"robots_notranslate":false,"robots_max_snippet":null,"robots_max_videopreview":null,"robots_max_imagepreview":"large","priority":null,"frequency":null,"local_seo":null,"seo_analyzer_scan_date":null,"breadcrumb_settings":null,"limit_modified_date":false,"reviewed_by":null,"ai":null,"created":"2021-02-28 14:58:40","updated":"2022-09-28 08:24:46","focus_keyword":null,"additional_keywords":null,"truseo_locale":null},"gt_translate_keys":[{"key":"link","format":"url"}],"_links":{"self":[{"href":"https:\/\/prohoster.info\/de\/wp-json\/wp\/v2\/posts\/84416","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/prohoster.info\/de\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/prohoster.info\/de\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/prohoster.info\/de\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/prohoster.info\/de\/wp-json\/wp\/v2\/comments?post=84416"}],"version-history":[{"count":0,"href":"https:\/\/prohoster.info\/de\/wp-json\/wp\/v2\/posts\/84416\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/prohoster.info\/de\/wp-json\/wp\/v2\/media\/84417"}],"wp:attachment":[{"href":"https:\/\/prohoster.info\/de\/wp-json\/wp\/v2\/media?parent=84416"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/prohoster.info\/de\/wp-json\/wp\/v2\/categories?post=84416"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/prohoster.info\/de\/wp-json\/wp\/v2\/tags?post=84416"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}