{"id":84416,"date":"2020-06-07T13:42:50","date_gmt":"2020-06-07T11:42:50","guid":{"rendered":"https:\/\/prohoster.info\/blog\/administrirovanie\/formaty-fajlov-v-bolshih-dannyh-kratkij-likbez"},"modified":"2020-06-07T13:42:50","modified_gmt":"2020-06-07T11:42:50","slug":"formaty-fajlov-v-bolshih-dannyh-kratkij-likbez","status":"publish","type":"post","link":"https:\/\/prohoster.info\/pl\/blog\/administrirovanie\/formaty-fajlov-v-bolshih-dannyh-kratkij-likbez","title":{"rendered":"Formaty plik\u00f3w w big data: kr\u00f3tki przewodnik","gt_translate_keys":[{"key":"rendered","format":"text"}]},"content":{"rendered":"<p><img decoding=\"async\" alt=\"Formaty plik\u00f3w w big data: kr\u00f3tki przewodnik\" src=\"\/wp-content\/uploads\/2020\/06\/c909979e0474bc6a1f7234cd88167220.png\" style=\"display:block;margin: 0 auto;\" \/><br \/>\n<noindex><a rel=\"nofollow\" href=\"https:\/\/www.deviantart.com\/remarin\/art\/Weather-Deity-743892889\"><i>B\u00f3g Pogody autorstwa Remarina<\/i><\/a><\/noindex> <\/p>\n<p>Zesp\u00f3\u0142 <noindex><a rel=\"nofollow\" href=\"https:\/\/mcs.mail.ru\/\">Mail.ru Cloud Solutions<\/a><\/noindex> oferuje <noindex><a rel=\"nofollow\" href=\"https:\/\/blog.clairvoyantsoft.com\/big-data-file-formats-3fb659903271\">t\u0142umaczenie artyku\u0142u<\/a><\/noindex> in\u017cyniera Rahula Bhatii z firmy Clairvoyant na temat format\u00f3w plik\u00f3w w big data, najbardziej powszechnych funkcji format\u00f3w Hadoop oraz tego, kt\u00f3ry format jest lepszy do u\u017cycia.<br \/>\n<noindex><a rel=\"nofollow\" name=\"habracut\"><\/a><\/noindex><\/p>\n<h2>Po co potrzebne s\u0105 r\u00f3\u017cne formaty plik\u00f3w<\/h2>\n<p>\nPowa\u017cnym w\u0105skim gard\u0142em w wydajno\u015bci aplikacji wspieraj\u0105cych HDFS, takich jak MapReduce i Spark, jest czas wyszukiwania, odczytu oraz zapisu danych. Problemy te pog\u0142\u0119biaj\u0105 trudno\u015bci w zarz\u0105dzaniu du\u017cymi zbiorami danych, gdy nie mamy sta\u0142ego, a ewolucyjnego schematu lub wyst\u0119puj\u0105 pewne ograniczenia przechowywania.<\/p>\n<p>Przetwarzanie big data zwi\u0119ksza obci\u0105\u017cenie systemu magazynowania \u2014 Hadoop przechowuje dane nadmiarowo, aby osi\u0105gn\u0105\u0107 odporno\u015b\u0107 na b\u0142\u0119dy. Opr\u00f3cz dysk\u00f3w obci\u0105\u017cone s\u0105 tak\u017ce procesor, sie\u0107, system wej\u015bcia\/wyj\u015bcia i tak dalej. W miar\u0119 wzrostu obj\u0119to\u015bci danych ro\u015bnie r\u00f3wnie\u017c koszt ich przetwarzania i przechowywania.<\/p>\n<p>R\u00f3\u017cne formaty plik\u00f3w w <noindex><a rel=\"nofollow\" href=\"https:\/\/mcs.mail.ru\/blog\/zachem-nuzhen-hadoop\">Hadoop<\/a><\/noindex> stworzono w celu rozwi\u0105zania tych problem\u00f3w. Wyb\u00f3r odpowiedniego formatu pliku mo\u017ce przynie\u015b\u0107 znacz\u0105ce korzy\u015bci:<\/p>\n<ol>\n<li>Szybszy czas odczytu.<\/li>\n<li>Szybszy czas zapisu.<\/li>\n<li>Pliki wsp\u00f3\u0142dzielone.<\/li>\n<li>Wsparcie dla ewolucji schemat\u00f3w.<\/li>\n<li>Rozszerzone wsparcie dla kompresji.<\/li>\n<\/ol>\n<p>\nNiekt\u00f3re formaty plik\u00f3w s\u0105 przeznaczone do og\u00f3lnego u\u017cytku, inne do bardziej specyficznych zastosowa\u0144, a jeszcze inne zosta\u0142y opracowane z my\u015bl\u0105 o konkretnych cechach danych. Wyb\u00f3r jest naprawd\u0119 bardzo du\u017cy.<\/p>\n<h2>Format plik\u00f3w Avro<\/h2>\n<p>\nDla <i>serializacji danych <\/i>szeroko wykorzystuje Avro \u2014 to <i>oparty na wierszach<\/i>, czyli wierszowy, format przechowywania danych w Hadoop. Przechowuje schemat w formacie JSON, co u\u0142atwia jego odczyt i interpretacj\u0119 przez dowolny program. Same dane s\u0105 przechowywane w formacie binarnym, kompaktowo i efektywnie.<\/p>\n<p>System serializacji Avro jest neutralny wzgl\u0119dem j\u0119zyka. Pliki mog\u0105 by\u0107 przetwarzane w r\u00f3\u017cnych j\u0119zykach, obecnie s\u0105 to C, C++, C#, Java, Python i Ruby.<\/p>\n<p>Kluczow\u0105 cech\u0105 Avro jest niezawodne wsparcie dla schemat\u00f3w danych, kt\u00f3re zmieniaj\u0105 si\u0119 w czasie, to znaczy ewoluuj\u0105. Avro rozumie zmiany w schemacie \u2014 usuwanie, dodawanie lub modyfikowanie p\u00f3l.<\/p>\n<p>Avro wspiera r\u00f3\u017cnorodne struktury danych. Na przyk\u0142ad, mo\u017cna stworzy\u0107 rekord, kt\u00f3ry zawiera tablic\u0119, typ wyliczeniowy i pod-rekord.<\/p>\n<p><img decoding=\"async\" alt=\"Formaty plik\u00f3w w big data: kr\u00f3tki przewodnik\" src=\"\/wp-content\/uploads\/2020\/06\/9bf044329ac0980a48a125c505dee265.png\" style=\"display:block;margin: 0 auto;\" \/><br \/>\nTen format idealnie nadaje si\u0119 do zapisu w strefie przej\u015bciowej jeziora danych (<noindex><a rel=\"nofollow\" href=\"https:\/\/mcs.mail.ru\/blog\/chto-takoe-ozera-dannyh-i-zachem-tam-hranyat-big-data\">jezioro danych<\/a><\/noindex>, czyli data lake \u2014 zbi\u00f3r instancji do przechowywania r\u00f3\u017cnych typ\u00f3w danych bezpo\u015brednio obok \u017ar\u00f3de\u0142 danych). <\/p>\n<p>Oto, dlaczego ten format najlepiej sprawdza si\u0119 do zapisu w strefie jeziora danych:<\/p>\n<ol>\n<li>Dane z tej strefy zazwyczaj s\u0105 odczytywane w ca\u0142o\u015bci do dalszego przetwarzania przez systemy ni\u017cszej warstwy \u2014 a format oparty na wierszach jest w tym przypadku bardziej efektywny.<\/li>\n<li>Systemy ni\u017cszej warstwy mog\u0105 \u0142atwo wyci\u0105ga\u0107 tabele schemat\u00f3w z plik\u00f3w \u2014 nie ma potrzeby przechowywania schemat\u00f3w osobno w zewn\u0119trznym magazynie metadanych.<\/li>\n<li>Ka\u017cda zmiana w pierwotnym schemacie jest \u0142atwo obs\u0142ugiwana (ewolucja schematu).<\/li>\n<\/ol>\n<p><\/p>\n<h2>Format plik\u00f3w Parquet<\/h2>\n<p>\nParquet to otwarto\u017ar\u00f3d\u0142owy format plik\u00f3w dla Hadoop, kt\u00f3ry przechowuje <i>zagnie\u017cd\u017cone struktury danych w p\u0142askim formacie kolumnowym.<\/i>.<\/p>\n<p>W por\u00f3wnaniu z tradycyjnym podej\u015bciem opartym na wierszach, Parquet jest bardziej efektywny pod wzgl\u0119dem przechowywania i wydajno\u015bci.<\/p>\n<p>To szczeg\u00f3lnie przydatne w przypadku zapyta\u0144, kt\u00f3re odczytuj\u0105 okre\u015blone kolumny z szerokiej (z wieloma kolumnami) tabeli. Dzi\u0119ki formatowi plik\u00f3w odczytywane s\u0105 tylko niezb\u0119dne kolumny, co minimalizuje operacje wej\u015bcia-wyj\u015bcia.<\/p>\n<p><strong>Ma\u0142e wprowadzenie - wyja\u015bnienie<\/strong>: aby lepiej zrozumie\u0107 format pliku Parquet w Hadoop, przyjrzyjmy si\u0119 formatowi opartemu na kolumnach \u2014 czyli kolumnowemu. W tym formacie przechowywane s\u0105 razem jednorodne warto\u015bci ka\u017cdej kolumny. <\/p>\n<p><noindex><a rel=\"nofollow\" href=\"http:\/\/netjs.blogspot.com\/\">Na przyk\u0142ad<\/a><\/noindex>, rekord zawiera pola ID, Name i Department. W tym przypadku wszystkie warto\u015bci kolumny ID b\u0119d\u0105 przechowywane razem, podobnie jak warto\u015bci kolumny Name i tak dalej. Tabela b\u0119dzie wygl\u0105da\u0107 mniej wi\u0119cej tak:<\/p>\n<p><strong>ID<\/strong><br \/>\n<strong>Name<\/strong><br \/>\n<strong>Department<\/strong><\/p>\n<p>1<br \/>\nemp1<br \/>\nd1<\/p>\n<p>2<br \/>\nemp2<br \/>\nd2<\/p>\n<p>3<br \/>\nemp3<br \/>\nd3<\/p>\n<p>\nW formacie wiersza dane zachowaj\u0105 si\u0119 w nast\u0119puj\u0105cy spos\u00f3b:<\/p>\n<p>1<br \/>\nemp1<br \/>\nd1<br \/>\n2<br \/>\nemp2<br \/>\nd2<br \/>\n3<br \/>\nemp3<br \/>\nd3<\/p>\n<p>\nW kolumnowym formacie plik\u00f3w te same dane b\u0119d\u0105 przechowywane w ten spos\u00f3b:<\/p>\n<p>1<br \/>\n2<br \/>\n3<br \/>\nemp1<br \/>\nemp2<br \/>\nemp3<br \/>\nd1<br \/>\nd2<br \/>\nd3<\/p>\n<p>\nFormat kolumnowy jest bardziej efektywny, gdy musisz wyci\u0105gn\u0105\u0107 z tabeli kilka kolumn. Odczyta tylko potrzebne kolumny, poniewa\u017c s\u0105 one blisko siebie. W ten spos\u00f3b operacje wej\u015bcia-wyj\u015bcia s\u0105 zminimalizowane.<\/p>\n<p>Na przyk\u0142ad potrzebujesz tylko kolumny NAME. W<noindex><a rel=\"nofollow\" href=\"http:\/\/netjs.blogspot.com\/\"> formacie wiersza<\/a><\/noindex> Ka\u017cdy wpis w zbiorze danych musi zosta\u0107 za\u0142adowany, rozdzielony na pola, a nast\u0119pnie nale\u017cy wydoby\u0107 dane NAME. Format kolumnowy pozwala bezpo\u015brednio przej\u015b\u0107 do kolumny Name, poniewa\u017c wszystkie warto\u015bci dla tej kolumny s\u0105 przechowywane razem. Nie ma potrzeby przeszukiwania ca\u0142ego wpisu.<\/p>\n<p>W ten spos\u00f3b format kolumnowy zwi\u0119ksza wydajno\u015b\u0107 zapyta\u0144, poniewa\u017c czas potrzebny na dotarcie do wymaganych kolumn jest kr\u00f3tszy, a liczba operacji wej\u015bcia-wyj\u015bcia jest zredukowana, poniewa\u017c czytane s\u0105 tylko potrzebne kolumny.<\/p>\n<p>Jedn\u0105 z unikalnych cech<noindex><a rel=\"nofollow\" href=\"http:\/\/netjs.blogspot.com\/\"> Parquet<\/a><\/noindex> jest to, \u017ce w takim formacie mo\u017ce <i>przechowywa\u0107 dane z zagnie\u017cd\u017conymi strukturami<\/i>. Oznacza to, \u017ce w pliku Parquet nawet zagnie\u017cd\u017cone pola mo\u017cna czyta\u0107 osobno, bez konieczno\u015bci odczytywania wszystkich p\u00f3l w zagnie\u017cd\u017conej strukturze. Do przechowywania zagnie\u017cd\u017conych struktur Parquet wykorzystuje algorytm rozdrobnienia i sk\u0142adania (shredding and assembly).<\/p>\n<p><img decoding=\"async\" alt=\"Formaty plik\u00f3w w big data: kr\u00f3tki przewodnik\" src=\"\/wp-content\/uploads\/2020\/06\/8cba9a4faccc4bac7c5bbc3eec163a3c.png\" style=\"display:block;margin: 0 auto;\" \/><br \/>\nAby zrozumie\u0107 format pliku Parquet w Hadoop, nale\u017cy zna\u0107 nast\u0119puj\u0105ce terminy:<\/p>\n<ol>\n<li><strong>Grupa wierszy<\/strong> (row group): logiczne poziome podzia\u0142 danych na wiersze. Grupa wierszy sk\u0142ada si\u0119 z fragmentu ka\u017cdej kolumny w zbiorze danych.<\/li>\n<li><strong>Fragment kolumny<\/strong> (kolumna chunk): fragment konkretnej kolumny. Te fragmenty kolumn znajduj\u0105 si\u0119 w okre\u015blonej grupie wierszy i b\u0119d\u0105 s\u0105siadowa\u0107 ze sob\u0105 w pliku.<\/li>\n<li><strong>Strona<\/strong> (strona): fragmenty kolumn s\u0105 dzielone na strony, zapisywane jedna po drugiej. Strony maj\u0105 wsp\u00f3lny nag\u0142\u00f3wek, wi\u0119c podczas czytania mo\u017cna pomin\u0105\u0107 niepotrzebne.<\/li>\n<\/ol>\n<p>\n<img decoding=\"async\" alt=\"Formaty plik\u00f3w w big data: kr\u00f3tki przewodnik\" src=\"\/wp-content\/uploads\/2020\/06\/0f3d583bc2f07b6fef8430f10433cc14.png\" style=\"display:block;margin: 0 auto;\" \/><br \/>\nTutaj nag\u0142\u00f3wek zawiera po prostu magiczn\u0105 liczb\u0119 <i>PAR1<\/i> (4 bajty), kt\u00f3ra identyfikuje plik jako plik formatu Parquet.<\/p>\n<p>W stopce zapisano nast\u0119puj\u0105ce:<\/p>\n<ol>\n<li>Metadane pliku, kt\u00f3re zawieraj\u0105 pocz\u0105tkowe wsp\u00f3\u0142rz\u0119dne metadanych ka\u017cdej kolumny. Podczas czytania nale\u017cy najpierw odczyta\u0107 metadane pliku, aby znale\u017a\u0107 wszystkie interesuj\u0105ce fragmenty kolumn. Nast\u0119pnie fragmenty kolumn nale\u017cy odczytywa\u0107 sekwencyjnie. Metadane zawieraj\u0105 r\u00f3wnie\u017c wersj\u0119 formatu, schemat oraz wszelkie dodatkowe pary klucz-warto\u015b\u0107.<\/li>\n<li>D\u0142ugo\u015b\u0107 metadanych (4 bajty).<\/li>\n<li>Magiczna liczba <i>PAR1<\/i> (4 bajty).<\/li>\n<\/ol>\n<p><\/p>\n<h2>Format plik\u00f3w ORC<\/h2>\n<p>\n<i>Optymalizowany format plik\u00f3w wierszowo-kolumnowych<\/i> (Optimized Row Columnar, <noindex><a rel=\"nofollow\" href=\"https:\/\/orc.apache.org\/\">ORC<\/a><\/noindex>) oferuje bardzo efektywny spos\u00f3b przechowywania danych i zosta\u0142 zaprojektowany, aby przezwyci\u0119\u017cy\u0107 ograniczenia innych format\u00f3w. Przechowuje dane w idealnie kompaktowej formie, pomijaj\u0105c zb\u0119dne szczeg\u00f3\u0142y \u2014 jednocze\u015bnie nie wymaga tworzenia du\u017cych, skomplikowanych ani r\u0119cznie zarz\u0105dzanych indeks\u00f3w. <\/p>\n<p>Zalety formatu ORC:<\/p>\n<ol>\n<li>Jeden plik jako wynik ka\u017cdej zada\u0144, co zmniejsza obci\u0105\u017cenie NameNode (w\u0119ze\u0142 nazw).<\/li>\n<li>Wsparcie dla typ\u00f3w danych Hive, w tym DateTime, typ\u00f3w dziesi\u0119tnych oraz z\u0142o\u017conych typ\u00f3w danych (struktura, lista, mapa, unia).<\/li>\n<li>Jednoczesne odczytywanie tego samego pliku przez r\u00f3\u017cne procesy RecordReader.<\/li>\n<li>Mo\u017cliwo\u015b\u0107 dzielenia plik\u00f3w bez skanowania pod k\u0105tem znacznik\u00f3w.<\/li>\n<li>Ocena maksymalnego przydzia\u0142u pami\u0119ci dla proces\u00f3w odczytu\/zapisu na podstawie informacji w stopce pliku.<\/li>\n<li>Metadane s\u0105 przechowywane w binarnym formacie serializacji Protocol Buffers, co pozwala na dodawanie i usuwanie p\u00f3l.<\/li>\n<\/ol>\n<p>\n<img decoding=\"async\" alt=\"Formaty plik\u00f3w w big data: kr\u00f3tki przewodnik\" src=\"\/wp-content\/uploads\/2020\/06\/342a51df1730398d5280484407461d8c.png\" style=\"display:block;margin: 0 auto;\" \/><br \/>\nORC przechowuje kolekcje wierszy w jednym pliku, a wewn\u0105trz kolekcji dane wierszowe s\u0105 przechowywane w formacie kolumnowym.<\/p>\n<p>Plik ORC przechowuje grupy wierszy, zwane paskami (stripes), oraz informacje pomocnicze w stopce pliku. Postscript na ko\u0144cu pliku zawiera parametry kompresji oraz rozmiar skompresowanej stopki.<\/p>\n<p>Domy\u015blny rozmiar paska wynosi 250 MB. Dzi\u0119ki takim du\u017cym paskom odczyt z HDFS jest bardziej efektywny: odbywa si\u0119 du\u017cymi, ci\u0105g\u0142ymi blokami.<\/p>\n<p>W stopce pliku zapisany jest wykaz pask\u00f3w w pliku, liczba wierszy na pasek oraz typ danych ka\u017cdej kolumny. Tam tak\u017ce zapisano warto\u015bci ko\u0144cowe count, min, max i sum dla ka\u017cdej kolumny.<\/p>\n<p>Stopka paska zawiera katalog lokalizacji strumienia.<\/p>\n<p>Dane szeregowe s\u0105 u\u017cywane podczas skanowania tabel.<\/p>\n<p>Dane indeksowe zawieraj\u0105 minimalne i maksymalne warto\u015bci dla ka\u017cdej kolumny oraz pozycje wierszy w ka\u017cdej kolumnie. Indeksy ORC s\u0105 u\u017cywane tylko do wyboru pask\u00f3w i grup wierszy, a nie do odpowiedzi na zapytania.<\/p>\n<h2>Por\u00f3wnanie r\u00f3\u017cnych format\u00f3w plik\u00f3w<\/h2>\n<p><\/p>\n<h3>Avro w por\u00f3wnaniu do Parquet<\/h3>\n<p><\/p>\n<ol>\n<li>Avro to format przechowywania po wierszach, podczas gdy Parquet przechowuje dane po kolumnach.<\/li>\n<li>Parquet lepiej nadaje si\u0119 do zapyta\u0144 analitycznych, to znaczy operacje odczytu i zapytania o dane s\u0105 znacznie bardziej efektywne ni\u017c zapisywanie.<\/li>\n<li>Operacje zapisu w Avro s\u0105 bardziej efektywne ni\u017c w Parquet.<\/li>\n<li>Avro lepiej radzi sobie z ewolucj\u0105 schemat\u00f3w. Parquet obs\u0142uguje jedynie dodawanie schematu, podczas gdy Avro posiada wielofunkcyjn\u0105 ewolucj\u0119, co oznacza dodawanie lub zmian\u0119 kolumn.<\/li>\n<li>Parquet jest idealny do zapyta\u0144 o podzestaw kolumn w tabeli z wieloma kolumnami. Avro sprawdza si\u0119 w operacjach ETL, gdzie \u017c\u0105damy wszystkich kolumn.<\/li>\n<\/ol>\n<p><\/p>\n<h3>ORC w por\u00f3wnaniu do Parquet<\/h3>\n<p><\/p>\n<ol>\n<li>Parquet lepiej przechowuje zagnie\u017cd\u017cone dane.<\/li>\n<li>ORC lepiej nadaje si\u0119 do przepychania predykat\u00f3w (predicate pushdown).<\/li>\n<li>ORC wspiera w\u0142a\u015bciwo\u015bci ACID.<\/li>\n<li>ORC lepiej kompresuje dane.<\/li>\n<\/ol>\n<p>\n<strong>Co jeszcze przeczyta\u0107 na ten temat<\/strong>:<\/p>\n<ol>\n<li><noindex><a rel=\"nofollow\" href=\"https:\/\/mcs.mail.ru\/blog\/analiz-bolshih-dannyh-v-oblake\">Analiza du\u017cych danych w chmurze: jak firmy mog\u0105 sta\u0107 si\u0119 zorientowane na dane<\/a><\/noindex>.<\/li>\n<li><noindex><a rel=\"nofollow\" href=\"https:\/\/habr.com\/ru\/company\/mailru\/blog\/501598\/\">Skromny przewodnik po schematach baz danych<\/a><\/noindex>.<\/li>\n<li><noindex><a rel=\"nofollow\" href=\"https:\/\/tele.click\/zavtra_oblachno\">Nasz kana\u0142 na Telegramie o cyfrowej transformacji<\/a><\/noindex>. \n<\/li>\n<\/ol>\n<p>\u0179r\u00f3d\u0142o: <a content=\"nofollow\" rel=\"nofollow\" href=\"https:\/\/habr.com\/ru\/company\/mailru\/blog\/504952\/\">habr.com<\/a> <\/p>","protected":false,"gt_translate_keys":[{"key":"rendered","format":"html"}]},"excerpt":{"rendered":"<p>Weather Deity by Remarin \u041a\u043e\u043c\u0430\u043d\u0434\u0430 Mail.ru Cloud Solutions \u043f\u0440\u0435\u0434\u043b\u0430\u0433\u0430\u0435\u0442 \u043f\u0435\u0440\u0435\u0432\u043e\u0434 \u0441\u0442\u0430\u0442\u044c\u0438 \u0438\u043d\u0436\u0435\u043d\u0435\u0440\u0430 \u0420\u0430\u0445\u0443\u043b\u0430 \u0411\u0445\u0430\u0442\u0438\u0438 \u0438\u0437 \u043a\u043e\u043c\u043f\u0430\u043d\u0438\u0438 Clairvoyant \u043e \u0442\u043e\u043c, \u043a\u0430\u043a\u0438\u0435 \u0435\u0441\u0442\u044c \u0444\u043e\u0440\u043c\u0430\u0442\u044b \u0444\u0430\u0439\u043b\u043e\u0432 \u0432 \u0431\u043e\u043b\u044c\u0448\u0438\u0445 \u0434\u0430\u043d\u043d\u044b\u0445, \u043a\u0430\u043a\u0438\u0435 \u0441\u0430\u043c\u044b\u0435 \u0440\u0430\u0441\u043f\u0440\u043e\u0441\u0442\u0440\u0430\u043d\u0435\u043d\u043d\u044b\u0435 \u0444\u0443\u043d\u043a\u0446\u0438\u0438 \u0444\u043e\u0440\u043c\u0430\u0442\u043e\u0432 Hadoop \u0438 \u043a\u0430\u043a\u043e\u0439 \u0444\u043e\u0440\u043c\u0430\u0442 \u043b\u0443\u0447\u0448\u0435 \u0438\u0441\u043f\u043e\u043b\u044c\u0437\u043e\u0432\u0430\u0442\u044c. \u0417\u0430\u0447\u0435\u043c \u043d\u0443\u0436\u043d\u044b \u0440\u0430\u0437\u043d\u044b\u0435 \u0444\u043e\u0440\u043c\u0430\u0442\u044b \u0444\u0430\u0439\u043b\u043e\u0432 \u0421\u0435\u0440\u044c\u0435\u0437\u043d\u043e\u0435 \u0443\u0437\u043a\u043e\u0435 \u043c\u0435\u0441\u0442\u043e \u0432 \u043f\u0440\u043e\u0438\u0437\u0432\u043e\u0434\u0438\u0442\u0435\u043b\u044c\u043d\u043e\u0441\u0442\u0438 \u043f\u0440\u0438\u043b\u043e\u0436\u0435\u043d\u0438\u0439 \u0441 \u043f\u043e\u0434\u0434\u0435\u0440\u0436\u043a\u043e\u0439 HDFS, \u0442\u0430\u043a\u0438\u0445 \u043a\u0430\u043a MapReduce \u0438 [&hellip;]<\/p>\n","protected":false,"gt_translate_keys":[{"key":"rendered","format":"html"}]},"author":1,"featured_media":84417,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[688],"tags":[],"class_list":["post-84416","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-administrirovanie"],"aioseo_notices":[],"aioseo_head":"\n\t\t<!-- All in One SEO 5.0.0.1 - aioseo.com -->\n\t<meta name=\"robots\" content=\"max-image-preview:large\" \/>\n\t<meta name=\"author\" content=\"Yuri Gagarin\"\/>\n\t<link rel=\"canonical\" href=\"https:\/\/prohoster.info\/pl\/blog\/administrirovanie\/formaty-fajlov-v-bolshih-dannyh-kratkij-likbez\" \/>\n\t<meta name=\"generator\" content=\"All in One SEO (AIOSEO) 5.0.0.1\" \/>\n\t\t<meta property=\"og:locale\" content=\"pl_PL\" \/>\n\t\t<meta property=\"og:site_name\" content=\"ProHoster | \u041a\u0443\u043f\u0438\u0442\u044c \u043d\u0430\u0434\u0435\u0436\u043d\u044b\u0439 \u0445\u043e\u0441\u0442\u0438\u043d\u0433 \u0434\u043b\u044f \u0441\u0430\u0439\u0442\u043e\u0432 \u0441 \u0437\u0430\u0449\u0438\u0442\u043e\u0439 \u043e\u0442 DDoS, VPS VDS \u0441\u0435\u0440\u0432\u0435\u0440\u044b\" \/>\n\t\t<meta property=\"og:type\" content=\"article\" \/>\n\t\t<meta property=\"og:title\" content=\"\ud83e\udd47\u0424\u043e\u0440\u043c\u0430\u0442\u044b \u0444\u0430\u0439\u043b\u043e\u0432 \u0432 \u0431\u043e\u043b\u044c\u0448\u0438\u0445 \u0434\u0430\u043d\u043d\u044b\u0445: \u043a\u0440\u0430\u0442\u043a\u0438\u0439 \u043b\u0438\u043a\u0431\u0435\u0437 | ProHoster\" \/>\n\t\t<meta property=\"og:url\" content=\"https:\/\/prohoster.info\/pl\/blog\/administrirovanie\/formaty-fajlov-v-bolshih-dannyh-kratkij-likbez\" \/>\n\t\t<meta property=\"og:image\" content=\"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg\" \/>\n\t\t<meta property=\"og:image:secure_url\" content=\"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg\" \/>\n\t\t<meta property=\"og:image:width\" content=\"350\" \/>\n\t\t<meta property=\"og:image:height\" content=\"350\" \/>\n\t\t<meta property=\"article:published_time\" content=\"2020-06-07T11:42:50+00:00\" \/>\n\t\t<meta property=\"article:modified_time\" content=\"2020-06-07T11:42:50+00:00\" \/>\n\t\t<meta property=\"article:publisher\" content=\"https:\/\/www.facebook.com\/prohoster\" \/>\n\t\t<meta property=\"article:author\" content=\"https:\/\/www.facebook.com\/prohoster\" \/>\n\t\t<!-- All in One SEO -->\n\n","aioseo_head_json":{"title":"\ud83e\udd47Formaty plik\u00f3w w du\u017cych danych: kr\u00f3tki przegl\u0105d | ProHoster","description":"","canonical_url":"https:\/\/prohoster.info\/pl\/blog\/administrirovanie\/formaty-fajlov-v-bolshih-dannyh-kratkij-likbez","robots":"max-image-preview:large","keywords":"","webmasterTools":{"miscellaneous":""},"schema":null,"og:locale":"pl_PL","og:site_name":"ProHoster | \u041a\u0443\u043f\u0438\u0442\u044c \u043d\u0430\u0434\u0435\u0436\u043d\u044b\u0439 \u0445\u043e\u0441\u0442\u0438\u043d\u0433 \u0434\u043b\u044f \u0441\u0430\u0439\u0442\u043e\u0432 \u0441 \u0437\u0430\u0449\u0438\u0442\u043e\u0439 \u043e\u0442 DDoS, VPS VDS \u0441\u0435\u0440\u0432\u0435\u0440\u044b","og:type":"article","og:title":"\ud83e\udd47\u0424\u043e\u0440\u043c\u0430\u0442\u044b \u0444\u0430\u0439\u043b\u043e\u0432 \u0432 \u0431\u043e\u043b\u044c\u0448\u0438\u0445 \u0434\u0430\u043d\u043d\u044b\u0445: \u043a\u0440\u0430\u0442\u043a\u0438\u0439 \u043b\u0438\u043a\u0431\u0435\u0437 | ProHoster","og:url":"https:\/\/prohoster.info\/pl\/blog\/administrirovanie\/formaty-fajlov-v-bolshih-dannyh-kratkij-likbez","og:image":"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg","og:image:secure_url":"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg","og:image:width":350,"og:image:height":350,"article:published_time":"2020-06-07T11:42:50+00:00","article:modified_time":"2020-06-07T11:42:50+00:00","article:publisher":"https:\/\/www.facebook.com\/prohoster","article:author":"https:\/\/www.facebook.com\/prohoster"},"aioseo_meta_data":{"post_id":"84416","title":null,"description":null,"keywords":null,"keyphrases":null,"primary_term":null,"canonical_url":null,"og_title":null,"og_description":null,"og_object_type":"default","og_image_type":"default","og_image_url":null,"og_image_width":null,"og_image_height":null,"og_image_custom_url":null,"og_image_custom_fields":null,"og_video":null,"og_custom_url":null,"og_article_section":null,"og_article_tags":null,"twitter_use_og":false,"twitter_card":"default","twitter_image_type":"default","twitter_image_url":null,"twitter_image_custom_url":null,"twitter_image_custom_fields":null,"twitter_title":null,"twitter_description":null,"schema":{"blockGraphs":[],"customGraphs":[],"default":{"data":{"Article":[],"Course":[],"Dataset":[],"FAQPage":[],"Movie":[],"Person":[],"Product":[],"ProductReview":[],"Car":[],"Recipe":[],"Service":[],"SoftwareApplication":[],"WebPage":[]},"graphName":"","isEnabled":true},"graphs":[]},"schema_type":null,"schema_type_options":null,"pillar_content":false,"robots_default":true,"robots_noindex":false,"robots_noarchive":false,"robots_nosnippet":false,"robots_nofollow":false,"robots_noimageindex":false,"robots_noodp":false,"robots_notranslate":false,"robots_max_snippet":null,"robots_max_videopreview":null,"robots_max_imagepreview":"large","priority":null,"frequency":null,"local_seo":null,"seo_analyzer_scan_date":null,"breadcrumb_settings":null,"limit_modified_date":false,"reviewed_by":null,"ai":null,"created":"2021-02-28 14:58:40","updated":"2022-09-28 08:24:46","focus_keyword":null,"additional_keywords":null,"truseo_locale":null},"gt_translate_keys":[{"key":"link","format":"url"}],"_links":{"self":[{"href":"https:\/\/prohoster.info\/pl\/wp-json\/wp\/v2\/posts\/84416","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/prohoster.info\/pl\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/prohoster.info\/pl\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/prohoster.info\/pl\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/prohoster.info\/pl\/wp-json\/wp\/v2\/comments?post=84416"}],"version-history":[{"count":0,"href":"https:\/\/prohoster.info\/pl\/wp-json\/wp\/v2\/posts\/84416\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/prohoster.info\/pl\/wp-json\/wp\/v2\/media\/84417"}],"wp:attachment":[{"href":"https:\/\/prohoster.info\/pl\/wp-json\/wp\/v2\/media?parent=84416"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/prohoster.info\/pl\/wp-json\/wp\/v2\/categories?post=84416"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/prohoster.info\/pl\/wp-json\/wp\/v2\/tags?post=84416"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}