{"id":84416,"date":"2020-06-07T13:42:50","date_gmt":"2020-06-07T11:42:50","guid":{"rendered":"https:\/\/prohoster.info\/blog\/administrirovanie\/formaty-fajlov-v-bolshih-dannyh-kratkij-likbez"},"modified":"2020-06-07T13:42:50","modified_gmt":"2020-06-07T11:42:50","slug":"formaty-fajlov-v-bolshih-dannyh-kratkij-likbez","status":"publish","type":"post","link":"https:\/\/prohoster.info\/pl\/blog\/administrirovanie\/formaty-fajlov-v-bolshih-dannyh-kratkij-likbez","title":{"rendered":"Formaty plik\u00f3w w big data: kr\u00f3tki przewodnik","gt_translate_keys":[{"key":"rendered","format":"text"}]},"content":{"rendered":"<p><img decoding=\"async\" alt=\"Formaty plik\u00f3w w big data: kr\u00f3tki przewodnik\" src=\"\/wp-content\/uploads\/2020\/06\/c909979e0474bc6a1f7234cd88167220.png\" style=\"display:block;margin: 0 auto;\" \/><br \/>\n<noindex><a rel=\"nofollow\" href=\"https:\/\/www.deviantart.com\/remarin\/art\/Weather-Deity-743892889\"><i>B\u00f3stwo pogody autorstwa Remarin<\/i><\/a><\/noindex> <\/p>\n<p>Zesp\u00f3\u0142 <noindex><a rel=\"nofollow\" href=\"https:\/\/mcs.mail.ru\/\">Mail.ru Cloud Solutions<\/a><\/noindex> oferuj\u0105c <noindex><a rel=\"nofollow\" href=\"https:\/\/blog.clairvoyantsoft.com\/big-data-file-formats-3fb659903271\">t\u0142umaczenie artyku\u0142u<\/a><\/noindex> in\u017cyniera Rahula Bhatia z firmy Clairvoyant o tym, jakie s\u0105 formaty plik\u00f3w w big data, jakie s\u0105 najcz\u0119\u015bciej u\u017cywane funkcje format\u00f3w Hadoop oraz jaki format najlepiej wykorzysta\u0107.<br \/>\n<noindex><a rel=\"nofollow\" name=\"habracut\"><\/a><\/noindex><\/p>\n<h2>Po co potrzebne s\u0105 r\u00f3\u017cne formaty plik\u00f3w<\/h2>\n<p>\nPowa\u017cnym w\u0105skim gard\u0142em w wydajno\u015bci aplikacji obs\u0142uguj\u0105cych HDFS, takich jak MapReduce i Spark, jest czas wyszukiwania, odczytu i zapisu danych. Problemy te zaostrzaj\u0105 trudno\u015bci w zarz\u0105dzaniu du\u017cymi zbiorami danych, je\u015bli mamy do czynienia z ewolucyjnym schematem, a tak\u017ce gdy wyst\u0119puj\u0105 pewne ograniczenia dotycz\u0105ce przechowywania.<\/p>\n<p>Przetwarzanie big data zwi\u0119ksza obci\u0105\u017cenie systemu magazynowania \u2014 Hadoop przechowuje dane redundandtne dla zapewnienia odporno\u015bci na awarie. Opr\u00f3cz dysk\u00f3w, obci\u0105\u017cony jest procesor, sie\u0107, system wej\u015bcia-wyj\u015bcia itd. Wraz ze wzrostem obj\u0119to\u015bci danych ro\u015bnie r\u00f3wnie\u017c koszt ich przetwarzania i przechowywania.<\/p>\n<p>R\u00f3\u017cne formaty plik\u00f3w w <noindex><a rel=\"nofollow\" href=\"https:\/\/mcs.mail.ru\/blog\/zachem-nuzhen-hadoop\">Hadoop<\/a><\/noindex> zosta\u0142y wymy\u015blone, aby rozwi\u0105za\u0107 te problemy. Wyb\u00f3r odpowiedniego formatu pliku mo\u017ce przynie\u015b\u0107 istotne korzy\u015bci:<\/p>\n<ol>\n<li>Szybszy czas odczytu.<\/li>\n<li>Szybszy czas zapisu.<\/li>\n<li>Pliki wsp\u00f3\u0142dzielone.<\/li>\n<li>Wsparcie dla ewolucji schem.<\/li>\n<li>Rozszerzone wsparcie kompresji.<\/li>\n<\/ol>\n<p>\nNiekt\u00f3re formaty plik\u00f3w s\u0105 przeznaczone do og\u00f3lnego u\u017cytku, inne do bardziej specyficznych zastosowa\u0144, a niekt\u00f3re s\u0105 zaprojektowane z uwzgl\u0119dnieniem konkretnych cech danych. Wyb\u00f3r jest wi\u0119c rzeczywi\u015bcie do\u015b\u0107 du\u017cy.<\/p>\n<h2>Format plik\u00f3w Avro<\/h2>\n<p>\nDla <i>serializacji danych <\/i>jest szeroko u\u017cywanym Avro \u2014 to <i>format przechowywania danych oparty na wierszach<\/i>, czyli tekstowy, w Hadoop. Przechowuje schemat w formacie JSON, co u\u0142atwia jego odczyt i interpretacj\u0119 przez jakikolwiek program. Same dane s\u0105 przechowywane w formacie binarnym, kompaktowo i efektywnie.<\/p>\n<p>System serializacji Avro jest neutralny wobec j\u0119zyka. Pliki mo\u017cna przetwarza\u0107 r\u00f3\u017cnymi j\u0119zykami, obecnie s\u0105 to C, C++, C#, Java, Python i Ruby.<\/p>\n<p>Kluczow\u0105 cech\u0105 Avro jest solidne wsparcie dla schemat\u00f3w danych, kt\u00f3re zmieniaj\u0105 si\u0119 z up\u0142ywem czasu, to znaczy ewoluuj\u0105. Avro rozumie zmiany schematu \u2014 usuwanie, dodawanie lub modyfikowanie p\u00f3l.<\/p>\n<p>Avro obs\u0142uguje r\u00f3\u017cnorodne struktury danych. Na przyk\u0142ad mo\u017cna utworzy\u0107 rekord, kt\u00f3ry zawiera tablic\u0119, typ wyliczeniowy i pod-rekord.<\/p>\n<p><img decoding=\"async\" alt=\"Formaty plik\u00f3w w big data: kr\u00f3tki przewodnik\" src=\"\/wp-content\/uploads\/2020\/06\/9bf044329ac0980a48a125c505dee265.png\" style=\"display:block;margin: 0 auto;\" \/><br \/>\nTen format idealnie nadaje si\u0119 do zapisywania w obszarze przejrzystym jeziora danych (<noindex><a rel=\"nofollow\" href=\"https:\/\/mcs.mail.ru\/blog\/chto-takoe-ozera-dannyh-i-zachem-tam-hranyat-big-data\">jezioro danych<\/a><\/noindex>, czyli data lake \u2014 kolekcja instancji do przechowywania r\u00f3\u017cnych typ\u00f3w danych w dodatku do bezpo\u015brednich \u017ar\u00f3de\u0142 danych). <\/p>\n<p>Tak wi\u0119c do zapisywania w strefie przesiadkowej jeziora danych ten format jest najlepszy z nast\u0119puj\u0105cych powod\u00f3w:<\/p>\n<ol>\n<li>Dane z tej strefy zwykle s\u0105 odczytywane w ca\u0142o\u015bci w celu dalszego przetwarzania przez ni\u017csze systemy \u2014 w tym przypadku format oparty na wierszach jest bardziej efektywny.<\/li>\n<li>Ni\u017csze systemy mog\u0105 \u0142atwo wydobywa\u0107 tabele schemat\u00f3w z plik\u00f3w \u2014 nie ma potrzeby przechowywania schemat\u00f3w oddzielnie w zewn\u0119trznej meta-przechowalni.<\/li>\n<li>Ka\u017cda zmiana w pierwotnym schemacie jest \u0142atwa do obs\u0142ugi (ewolucja schematu).<\/li>\n<\/ol>\n<p><\/p>\n<h2>Format plik\u00f3w Parquet<\/h2>\n<p>\nParquet to otwarto\u017ar\u00f3d\u0142owy format plik\u00f3w dla Hadoop, kt\u00f3ry przechowuje <i>zagnie\u017cd\u017cone struktury danych w p\u0142askim formacie kolumnowym<\/i>.<\/p>\n<p>W por\u00f3wnaniu do tradycyjnego podej\u015bcia opartego na wierszach, Parquet jest bardziej efektywny pod wzgl\u0119dem przechowywania i wydajno\u015bci.<\/p>\n<p>Jest to szczeg\u00f3lnie przydatne dla zapyta\u0144, kt\u00f3re odczytuj\u0105 okre\u015blone kolumny z szerokiej (z wieloma kolumnami) tabeli. Dzi\u0119ki formatowi plik\u00f3w odczytywane s\u0105 tylko potrzebne kolumny, co minimalizuje operacje wej\u015bcia-wyj\u015bcia.<\/p>\n<p><strong>Ma\u0142e wyja\u015bnienie<\/strong>: aby lepiej zrozumie\u0107 format pliku Parquet w Hadoop, sp\u00f3jrzmy, co oznacza format oparty na kolumnach \u2014 to znaczy format kolumnowy. W takim formacie razem przechowywane s\u0105 jednorodne warto\u015bci ka\u017cdej kolumny. <\/p>\n<p><noindex><a rel=\"nofollow\" href=\"http:\/\/netjs.blogspot.com\/\">Na przyk\u0142ad<\/a><\/noindex>, zapis obejmuje pola ID, Name i Department. W takim przypadku wszystkie warto\u015bci kolumny ID b\u0119d\u0105 przechowywane razem, tak samo jak warto\u015bci kolumny Name i tak dalej. Tabela b\u0119dzie mia\u0142a mniej wi\u0119cej taki wygl\u0105d:<\/p>\n<p><strong>ID<\/strong><br \/>\n<strong>Nazwa<\/strong><br \/>\n<strong>Department<\/strong><\/p>\n<p>1<br \/>\nemp1<br \/>\nd1<\/p>\n<p>2<br \/>\nemp2<br \/>\nd2<\/p>\n<p>3<br \/>\nemp3<br \/>\nd3<\/p>\n<p>\nW formacie wierszowym dane b\u0119d\u0105 przechowywane w nast\u0119puj\u0105cy spos\u00f3b:<\/p>\n<p>1<br \/>\nemp1<br \/>\nd1<br \/>\n2<br \/>\nemp2<br \/>\nd2<br \/>\n3<br \/>\nemp3<br \/>\nd3<\/p>\n<p>\nW kolumnowym formacie plik\u00f3w te same dane b\u0119d\u0105 przechowywane tak:<\/p>\n<p>1<br \/>\n2<br \/>\n3<br \/>\nemp1<br \/>\nemp2<br \/>\nemp3<br \/>\nd1<br \/>\nd2<br \/>\nd3<\/p>\n<p>\nFormat kolumnowy jest bardziej efektywny, gdy potrzebujesz zapyta\u0107 o kilka kolumn z tabeli. Odczyta tylko potrzebne kolumny, poniewa\u017c znajduj\u0105 si\u0119 one blisko siebie. W ten spos\u00f3b operacje wej\u015bcia-wyj\u015bcia s\u0105 minimalizowane.<\/p>\n<p>Na przyk\u0142ad potrzebujesz tylko kolumny NAME. W<noindex><a rel=\"nofollow\" href=\"http:\/\/netjs.blogspot.com\/\"> formacie wierszowym<\/a><\/noindex> Ka\u017cdy wpis w zestawie danych musi zosta\u0107 za\u0142adowany, rozdzielony na pola, a nast\u0119pnie wyodr\u0119bnione musz\u0105 by\u0107 dane NAME. Format kolumnowy pozwala przej\u015b\u0107 bezpo\u015brednio do kolumny Name, poniewa\u017c wszystkie warto\u015bci dla tej kolumny s\u0105 przechowywane razem. Nie trzeba przeszukiwa\u0107 ca\u0142ego wpisu.<\/p>\n<p>W ten spos\u00f3b format kolumnowy zwi\u0119ksza wydajno\u015b\u0107 zapyta\u0144, poniewa\u017c przej\u015bcie do wymaganych kolumn wymaga mniej czasu wyszukiwania i zmniejsza liczb\u0119 operacji wej\u015bcia\/wyj\u015bcia, poniewa\u017c odczytywane s\u0105 tylko potrzebne kolumny.<\/p>\n<p>Jedn\u0105 z unikalnych cech<noindex><a rel=\"nofollow\" href=\"http:\/\/netjs.blogspot.com\/\"> Parquet<\/a><\/noindex> jest to, \u017ce w tym formacie mo\u017ce <i>przechowywa\u0107 dane z zagnie\u017cd\u017conymi strukturami<\/i>. Oznacza to, \u017ce w pliku Parquet nawet zagnie\u017cd\u017cone pola mo\u017cna odczytywa\u0107 oddzielnie, bez konieczno\u015bci odczytywania wszystkich p\u00f3l w zagnie\u017cd\u017conej strukturze. Aby przechowywa\u0107 zagnie\u017cd\u017cone struktury, Parquet korzysta z algorytmu rozdrabniania i sk\u0142adania (shredding and assembly).<\/p>\n<p><img decoding=\"async\" alt=\"Formaty plik\u00f3w w big data: kr\u00f3tki przewodnik\" src=\"\/wp-content\/uploads\/2020\/06\/8cba9a4faccc4bac7c5bbc3eec163a3c.png\" style=\"display:block;margin: 0 auto;\" \/><br \/>\nAby zrozumie\u0107 format pliku Parquet w Hadoop, nale\u017cy zna\u0107 nast\u0119puj\u0105ce terminy:<\/p>\n<ol>\n<li><strong>Grupa wierszy<\/strong> (row group): logiczne poziome podzielenie danych na wiersze. Grupa wierszy sk\u0142ada si\u0119 z fragmentu ka\u017cdego kolumny w zestawie danych.<\/li>\n<li><strong>Fragment kolumny<\/strong> (column chunk): fragment konkretnej kolumny. Te fragmenty kolumn \u017cyj\u0105 w okre\u015blonej grupie wierszy i b\u0119d\u0105 gwarantowanie s\u0105siaduj\u0105ce w pliku.<\/li>\n<li><strong>Strona<\/strong> (page): fragmenty kolumn dziel\u0105 si\u0119 na strony, zapisywane jedna po drugiej. Strony maj\u0105 wsp\u00f3lny nag\u0142\u00f3wek, wi\u0119c przy odczycie mo\u017cna pomin\u0105\u0107 niepotrzebne.<\/li>\n<\/ol>\n<p>\n<img decoding=\"async\" alt=\"Formaty plik\u00f3w w big data: kr\u00f3tki przewodnik\" src=\"\/wp-content\/uploads\/2020\/06\/0f3d583bc2f07b6fef8430f10433cc14.png\" style=\"display:block;margin: 0 auto;\" \/><br \/>\nTutaj nag\u0142\u00f3wek zawiera po prostu magiczn\u0105 liczb\u0119 <i>PAR1<\/i> (4 bajty), kt\u00f3ra identyfikuje plik jako plik formatu Parquet.<\/p>\n<p>W stopce zapisano nast\u0119puj\u0105ce:<\/p>\n<ol>\n<li>Metadane pliku, kt\u00f3re zawieraj\u0105 startowe wsp\u00f3\u0142rz\u0119dne metadanych ka\u017cdej kolumny. Przy odczycie nale\u017cy najpierw odczyta\u0107 metadane pliku, aby znale\u017a\u0107 wszystkie interesuj\u0105ce fragmenty kolumn. Nast\u0119pnie fragmenty kolumn nale\u017cy odczytywa\u0107 sekwencyjnie. Dodatkowo metadane zawieraj\u0105 wersj\u0119 formatu, schemat oraz wszystkie dodatkowe pary klucz-warto\u015b\u0107.<\/li>\n<li>D\u0142ugo\u015b\u0107 metadanych (4 bajty).<\/li>\n<li>Magiczna liczba <i>PAR1<\/i> (4 bajty).<\/li>\n<\/ol>\n<p><\/p>\n<h2>Format plik\u00f3w ORC<\/h2>\n<p>\n<i>Optymalizowany format plik\u00f3w wierszowo-kolumnowy<\/i> (Optimized Row Columnar, <noindex><a rel=\"nofollow\" href=\"https:\/\/orc.apache.org\/\">ORC<\/a><\/noindex>) oferuje bardzo skuteczny spos\u00f3b przechowywania danych i zosta\u0142 zaprojektowany, aby przezwyci\u0119\u017cy\u0107 ograniczenia innych format\u00f3w. Przechowuje dane w idealnie kompaktowej formie, pozwalaj\u0105c na pomini\u0119cie niepotrzebnych szczeg\u00f3\u0142\u00f3w \u2014 jednocze\u015bnie nie wymaga tworzenia du\u017cych, skomplikowanych lub r\u0119cznie zarz\u0105dzanych indeks\u00f3w. <\/p>\n<p>Zalety formatu ORC:<\/p>\n<ol>\n<li>Jedna plik na wyj\u015bciu ka\u017cdego zadania, co zmniejsza obci\u0105\u017cenie NameNode'a (w\u0119ze\u0142 nazw).<\/li>\n<li>Wsparcie dla typ\u00f3w danych Hive, w tym DateTime, typy dziesi\u0119tne i z\u0142o\u017cone (struct, list, map i union).<\/li>\n<li>Jednoczesne odczytywanie tego samego pliku przez r\u00f3\u017cne procesy RecordReader.<\/li>\n<li>Mo\u017cliwo\u015b\u0107 dzielenia plik\u00f3w bez skanowania w poszukiwaniu znacznik\u00f3w.<\/li>\n<li>Osza\u0142amiaj\u0105ca ocena maksymalnego przydzia\u0142u pami\u0119ci stosu do proces\u00f3w odczytu\/zapisu na podstawie informacji w stopce pliku.<\/li>\n<li>Metadane s\u0105 przechowywane w binarnym formacie serializacji Protocol Buffers, co umo\u017cliwia dodawanie i usuwanie p\u00f3l.<\/li>\n<\/ol>\n<p>\n<img decoding=\"async\" alt=\"Formaty plik\u00f3w w big data: kr\u00f3tki przewodnik\" src=\"\/wp-content\/uploads\/2020\/06\/342a51df1730398d5280484407461d8c.png\" style=\"display:block;margin: 0 auto;\" \/><br \/>\nORC przechowuje kolekcje wierszy w jednym pliku, a w ramach kolekcji dane wierszy s\u0105 przechowywane w formacie kolumnowym.<\/p>\n<p>Plik ORC przechowuje grupy wierszy, kt\u00f3re nazywane s\u0105 pasmami (stripes) oraz dodatkowe informacje w stopce pliku. Postscript na ko\u0144cu pliku zawiera parametry kompresji oraz rozmiar skompresowanej stopki.<\/p>\n<p>Domy\u015blny rozmiar pasa wynosi 250 MB. Dzi\u0119ki tak du\u017cym pasmom odczyt z HDFS jest bardziej efektywny: du\u017cymi ci\u0105g\u0142ymi blokami.<\/p>\n<p>W stopce pliku zapisano list\u0119 pas\u00f3w w pliku, liczb\u0119 wierszy na pas oraz typ danych ka\u017cdej kolumny. Tam tak\u017ce zapisano warto\u015bci wyniki count, min, max i sum dla ka\u017cdej kolumny.<\/p>\n<p>Stopka pasa zawiera katalog lokalizacji strumienia.<\/p>\n<p>Dane wierszowe s\u0105 u\u017cywane podczas skanowania tabel.<\/p>\n<p>Dane indeksowe obejmuj\u0105 minimalne i maksymalne warto\u015bci dla ka\u017cdej kolumny i pozycje wierszy w ka\u017cdej kolumnie. Indeksy ORC s\u0105 wykorzystywane tylko do wyboru pas\u00f3w i grup wierszy, a nie do odpowiadania na zapytania.<\/p>\n<h2>Por\u00f3wnanie r\u00f3\u017cnych format\u00f3w plik\u00f3w<\/h2>\n<p><\/p>\n<h3>Avro w por\u00f3wnaniu z Parquet<\/h3>\n<p><\/p>\n<ol>\n<li>Avro to format przechowywania wierszy, podczas gdy Parquet przechowuje dane w kolumnach.<\/li>\n<li>Parquet jest lepiej przystosowany do zapyta\u0144 analitycznych, co oznacza, \u017ce operacje odczytu i zapytania danych s\u0105 znacznie bardziej efektywne ni\u017c zapisy.<\/li>\n<li>Operacje zapisu w Avro s\u0105 realizowane efektywniej ni\u017c w Parquet.<\/li>\n<li>Avro dzia\u0142a bardziej dojrza\u0142o, je\u015bli chodzi o ewolucj\u0119 schemat\u00f3w. Parquet obs\u0142uguje jedynie dodawanie schematu, a w Avro zrealizowano wielofunkcyjn\u0105 ewolucj\u0119, co oznacza dodawanie lub modyfikacj\u0119 kolumn.<\/li>\n<li>Parquet idealnie nadaje si\u0119 do zapyta\u0144 o podzestawy kolumn w tabeli wielokolumnowej. Avro sprawdza si\u0119 w operacjach ETL, gdzie \u017c\u0105damy wszystkich kolumn.<\/li>\n<\/ol>\n<p><\/p>\n<h3>ORC w por\u00f3wnaniu do Parquet<\/h3>\n<p><\/p>\n<ol>\n<li>Parquet lepiej przechowuje dane zagnie\u017cd\u017cone.<\/li>\n<li>ORC lepiej przystosowuje si\u0119 do pchania predykat\u00f3w (predicate pushdown).<\/li>\n<li>ORC obs\u0142uguje w\u0142a\u015bciwo\u015bci ACID.<\/li>\n<li>ORC lepiej kompresuje dane.<\/li>\n<\/ol>\n<p>\n<strong>Co jeszcze przeczyta\u0107 na ten temat<\/strong>:<\/p>\n<ol>\n<li><noindex><a rel=\"nofollow\" href=\"https:\/\/mcs.mail.ru\/blog\/analiz-bolshih-dannyh-v-oblake\">Analiza du\u017cych danych w chmurze: jak firmy mog\u0105 sta\u0107 si\u0119 zorientowane na dane<\/a><\/noindex>.<\/li>\n<li><noindex><a rel=\"nofollow\" href=\"https:\/\/habr.com\/ru\/company\/mailru\/blog\/501598\/\">Skromny przewodnik po schematach baz danych<\/a><\/noindex>.<\/li>\n<li><noindex><a rel=\"nofollow\" href=\"https:\/\/tele.click\/zavtra_oblachno\">Nasz kana\u0142 Telegram o transformacji cyfrowej<\/a><\/noindex>. \n<\/li>\n<\/ol>\n<p>\u0179r\u00f3d\u0142o: <a content=\"nofollow\" rel=\"nofollow\" href=\"https:\/\/habr.com\/ru\/company\/mailru\/blog\/504952\/\">habr.com<\/a> <\/p>","protected":false,"gt_translate_keys":[{"key":"rendered","format":"html"}]},"excerpt":{"rendered":"<p>Weather Deity by Remarin \u041a\u043e\u043c\u0430\u043d\u0434\u0430 Mail.ru Cloud Solutions \u043f\u0440\u0435\u0434\u043b\u0430\u0433\u0430\u0435\u0442 \u043f\u0435\u0440\u0435\u0432\u043e\u0434 \u0441\u0442\u0430\u0442\u044c\u0438 \u0438\u043d\u0436\u0435\u043d\u0435\u0440\u0430 \u0420\u0430\u0445\u0443\u043b\u0430 \u0411\u0445\u0430\u0442\u0438\u0438 \u0438\u0437 \u043a\u043e\u043c\u043f\u0430\u043d\u0438\u0438 Clairvoyant \u043e \u0442\u043e\u043c, \u043a\u0430\u043a\u0438\u0435 \u0435\u0441\u0442\u044c \u0444\u043e\u0440\u043c\u0430\u0442\u044b \u0444\u0430\u0439\u043b\u043e\u0432 \u0432 \u0431\u043e\u043b\u044c\u0448\u0438\u0445 \u0434\u0430\u043d\u043d\u044b\u0445, \u043a\u0430\u043a\u0438\u0435 \u0441\u0430\u043c\u044b\u0435 \u0440\u0430\u0441\u043f\u0440\u043e\u0441\u0442\u0440\u0430\u043d\u0435\u043d\u043d\u044b\u0435 \u0444\u0443\u043d\u043a\u0446\u0438\u0438 \u0444\u043e\u0440\u043c\u0430\u0442\u043e\u0432 Hadoop \u0438 \u043a\u0430\u043a\u043e\u0439 \u0444\u043e\u0440\u043c\u0430\u0442 \u043b\u0443\u0447\u0448\u0435 \u0438\u0441\u043f\u043e\u043b\u044c\u0437\u043e\u0432\u0430\u0442\u044c. \u0417\u0430\u0447\u0435\u043c \u043d\u0443\u0436\u043d\u044b \u0440\u0430\u0437\u043d\u044b\u0435 \u0444\u043e\u0440\u043c\u0430\u0442\u044b \u0444\u0430\u0439\u043b\u043e\u0432 \u0421\u0435\u0440\u044c\u0435\u0437\u043d\u043e\u0435 \u0443\u0437\u043a\u043e\u0435 \u043c\u0435\u0441\u0442\u043e \u0432 \u043f\u0440\u043e\u0438\u0437\u0432\u043e\u0434\u0438\u0442\u0435\u043b\u044c\u043d\u043e\u0441\u0442\u0438 \u043f\u0440\u0438\u043b\u043e\u0436\u0435\u043d\u0438\u0439 \u0441 \u043f\u043e\u0434\u0434\u0435\u0440\u0436\u043a\u043e\u0439 HDFS, \u0442\u0430\u043a\u0438\u0445 \u043a\u0430\u043a MapReduce \u0438 [&hellip;]<\/p>\n","protected":false,"gt_translate_keys":[{"key":"rendered","format":"html"}]},"author":1,"featured_media":84417,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[688],"tags":[],"class_list":["post-84416","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-administrirovanie"],"aioseo_notices":[],"aioseo_head":"\n\t\t<!-- All in One SEO 5.0.1.1 - aioseo.com -->\n\t<meta name=\"robots\" content=\"max-image-preview:large\" \/>\n\t<meta name=\"author\" content=\"Yuri Gagarin\"\/>\n\t<link rel=\"canonical\" href=\"https:\/\/prohoster.info\/pl\/blog\/administrirovanie\/formaty-fajlov-v-bolshih-dannyh-kratkij-likbez\" \/>\n\t<meta name=\"generator\" content=\"All in One SEO (AIOSEO) 5.0.1.1\" \/>\n\t\t<meta property=\"og:locale\" content=\"pl_PL\" \/>\n\t\t<meta property=\"og:site_name\" content=\"ProHoster | \u041a\u0443\u043f\u0438\u0442\u044c \u043d\u0430\u0434\u0435\u0436\u043d\u044b\u0439 \u0445\u043e\u0441\u0442\u0438\u043d\u0433 \u0434\u043b\u044f \u0441\u0430\u0439\u0442\u043e\u0432 \u0441 \u0437\u0430\u0449\u0438\u0442\u043e\u0439 \u043e\u0442 DDoS, VPS VDS \u0441\u0435\u0440\u0432\u0435\u0440\u044b\" \/>\n\t\t<meta property=\"og:type\" content=\"article\" \/>\n\t\t<meta property=\"og:title\" content=\"\ud83e\udd47\u0424\u043e\u0440\u043c\u0430\u0442\u044b \u0444\u0430\u0439\u043b\u043e\u0432 \u0432 \u0431\u043e\u043b\u044c\u0448\u0438\u0445 \u0434\u0430\u043d\u043d\u044b\u0445: \u043a\u0440\u0430\u0442\u043a\u0438\u0439 \u043b\u0438\u043a\u0431\u0435\u0437 | ProHoster\" \/>\n\t\t<meta property=\"og:url\" content=\"https:\/\/prohoster.info\/pl\/blog\/administrirovanie\/formaty-fajlov-v-bolshih-dannyh-kratkij-likbez\" \/>\n\t\t<meta property=\"og:image\" content=\"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg\" \/>\n\t\t<meta property=\"og:image:secure_url\" content=\"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg\" \/>\n\t\t<meta property=\"og:image:width\" content=\"350\" \/>\n\t\t<meta property=\"og:image:height\" content=\"350\" \/>\n\t\t<meta property=\"article:published_time\" content=\"2020-06-07T11:42:50+00:00\" \/>\n\t\t<meta property=\"article:modified_time\" content=\"2020-06-07T11:42:50+00:00\" \/>\n\t\t<meta property=\"article:publisher\" content=\"https:\/\/www.facebook.com\/prohoster\" \/>\n\t\t<meta property=\"article:author\" content=\"https:\/\/www.facebook.com\/prohoster\" \/>\n\t\t<!-- All in One SEO -->\n\n","aioseo_head_json":{"title":"\ud83e\udd47Formaty plik\u00f3w w du\u017cych danych: kr\u00f3tki przewodnik | ProHoster","description":"","canonical_url":"https:\/\/prohoster.info\/pl\/blog\/administrirovanie\/formaty-fajlov-v-bolshih-dannyh-kratkij-likbez","robots":"max-image-preview:large","keywords":"","webmasterTools":{"miscellaneous":""},"schema":null,"og:locale":"pl_PL","og:site_name":"ProHoster | \u041a\u0443\u043f\u0438\u0442\u044c \u043d\u0430\u0434\u0435\u0436\u043d\u044b\u0439 \u0445\u043e\u0441\u0442\u0438\u043d\u0433 \u0434\u043b\u044f \u0441\u0430\u0439\u0442\u043e\u0432 \u0441 \u0437\u0430\u0449\u0438\u0442\u043e\u0439 \u043e\u0442 DDoS, VPS VDS \u0441\u0435\u0440\u0432\u0435\u0440\u044b","og:type":"article","og:title":"\ud83e\udd47\u0424\u043e\u0440\u043c\u0430\u0442\u044b \u0444\u0430\u0439\u043b\u043e\u0432 \u0432 \u0431\u043e\u043b\u044c\u0448\u0438\u0445 \u0434\u0430\u043d\u043d\u044b\u0445: \u043a\u0440\u0430\u0442\u043a\u0438\u0439 \u043b\u0438\u043a\u0431\u0435\u0437 | ProHoster","og:url":"https:\/\/prohoster.info\/pl\/blog\/administrirovanie\/formaty-fajlov-v-bolshih-dannyh-kratkij-likbez","og:image":"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg","og:image:secure_url":"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg","og:image:width":350,"og:image:height":350,"article:published_time":"2020-06-07T11:42:50+00:00","article:modified_time":"2020-06-07T11:42:50+00:00","article:publisher":"https:\/\/www.facebook.com\/prohoster","article:author":"https:\/\/www.facebook.com\/prohoster"},"aioseo_meta_data":{"post_id":"84416","title":null,"description":null,"keywords":null,"keyphrases":null,"primary_term":null,"canonical_url":null,"og_title":null,"og_description":null,"og_object_type":"default","og_image_type":"default","og_image_url":null,"og_image_width":null,"og_image_height":null,"og_image_custom_url":null,"og_image_custom_fields":null,"og_video":null,"og_custom_url":null,"og_article_section":null,"og_article_tags":null,"twitter_use_og":false,"twitter_card":"default","twitter_image_type":"default","twitter_image_url":null,"twitter_image_custom_url":null,"twitter_image_custom_fields":null,"twitter_title":null,"twitter_description":null,"schema":{"blockGraphs":[],"customGraphs":[],"default":{"data":{"Article":[],"Course":[],"Dataset":[],"FAQPage":[],"Movie":[],"Person":[],"Product":[],"ProductReview":[],"Car":[],"Recipe":[],"Service":[],"SoftwareApplication":[],"WebPage":[]},"graphName":"","isEnabled":true},"graphs":[]},"schema_type":null,"schema_type_options":null,"pillar_content":false,"robots_default":true,"robots_noindex":false,"robots_noarchive":false,"robots_nosnippet":false,"robots_nofollow":false,"robots_noimageindex":false,"robots_noodp":false,"robots_notranslate":false,"robots_max_snippet":null,"robots_max_videopreview":null,"robots_max_imagepreview":"large","priority":null,"frequency":null,"local_seo":null,"seo_analyzer_scan_date":null,"breadcrumb_settings":null,"limit_modified_date":false,"reviewed_by":null,"ai":null,"created":"2021-02-28 14:58:40","updated":"2022-09-28 08:24:46","focus_keyword":null,"additional_keywords":null,"truseo_locale":null},"gt_translate_keys":[{"key":"link","format":"url"}],"_links":{"self":[{"href":"https:\/\/prohoster.info\/pl\/wp-json\/wp\/v2\/posts\/84416","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/prohoster.info\/pl\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/prohoster.info\/pl\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/prohoster.info\/pl\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/prohoster.info\/pl\/wp-json\/wp\/v2\/comments?post=84416"}],"version-history":[{"count":0,"href":"https:\/\/prohoster.info\/pl\/wp-json\/wp\/v2\/posts\/84416\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/prohoster.info\/pl\/wp-json\/wp\/v2\/media\/84417"}],"wp:attachment":[{"href":"https:\/\/prohoster.info\/pl\/wp-json\/wp\/v2\/media?parent=84416"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/prohoster.info\/pl\/wp-json\/wp\/v2\/categories?post=84416"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/prohoster.info\/pl\/wp-json\/wp\/v2\/tags?post=84416"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}