{"id":84416,"date":"2020-06-07T13:42:50","date_gmt":"2020-06-07T11:42:50","guid":{"rendered":"https:\/\/prohoster.info\/blog\/administrirovanie\/formaty-fajlov-v-bolshih-dannyh-kratkij-likbez"},"modified":"2020-06-07T13:42:50","modified_gmt":"2020-06-07T11:42:50","slug":"formaty-fajlov-v-bolshih-dannyh-kratkij-likbez","status":"publish","type":"post","link":"https:\/\/prohoster.info\/es\/blog\/administrirovanie\/formaty-fajlov-v-bolshih-dannyh-kratkij-likbez","title":{"rendered":"Formatos de archivos en grandes datos: breve introducci\u00f3n","gt_translate_keys":[{"key":"rendered","format":"text"}]},"content":{"rendered":"<p><img decoding=\"async\" alt=\"Formatos de archivos en grandes datos: breve introducci\u00f3n\" src=\"\/wp-content\/uploads\/2020\/06\/c909979e0474bc6a1f7234cd88167220.png\" style=\"display:block;margin: 0 auto;\" \/><br \/>\n<noindex><a rel=\"nofollow\" href=\"https:\/\/www.deviantart.com\/remarin\/art\/Weather-Deity-743892889\"><i>Deidad del Tiempo de Remarin<\/i><\/a><\/noindex> <\/p>\n<p>Comando <noindex><a rel=\"nofollow\" href=\"https:\/\/mcs.mail.ru\/\">Soluciones en la Nube de Mail.ru<\/a><\/noindex> ofrece <noindex><a rel=\"nofollow\" href=\"https:\/\/blog.clairvoyantsoft.com\/big-data-file-formats-3fb659903271\">la traducci\u00f3n de un art\u00edculo<\/a><\/noindex> del ingeniero Rahul Bhatia de Clairvoyant sobre los formatos de archivo en big data, las funciones m\u00e1s comunes de los formatos de Hadoop y cu\u00e1l formato es el mejor para usar.<br \/>\n<noindex><a rel=\"nofollow\" name=\"habracut\"><\/a><\/noindex><\/p>\n<h2>\u00bfPor qu\u00e9 son necesarios diferentes formatos de archivos?<\/h2>\n<p>\nUn punto cr\u00edtico en el rendimiento de las aplicaciones que soportan HDFS, como MapReduce y Spark, es el tiempo de b\u00fasqueda, lectura y escritura de datos. Estos problemas se agravan por las dificultades en la gesti\u00f3n de grandes conjuntos de datos, especialmente si no tenemos un esquema fijo, sino uno en evoluci\u00f3n, o si hay ciertas limitaciones de almacenamiento.<\/p>\n<p>El procesamiento de big data aumenta la carga en el subsistema de almacenamiento: Hadoop almacena datos de manera redundante para lograr resistencia a fallos. Adem\u00e1s de los discos, tambi\u00e9n se sobrecargan el procesador, la red, el sistema de entrada\/salida, etc. A medida que aumenta el volumen de datos, tambi\u00e9n lo hacen los costos de su procesamiento y almacenamiento.<\/p>\n<p>Los diferentes formatos de archivo en <noindex><a rel=\"nofollow\" href=\"https:\/\/mcs.mail.ru\/blog\/zachem-nuzhen-hadoop\">Hadoop<\/a><\/noindex> han sido dise\u00f1ados precisamente para abordar estos problemas. Elegir el formato de archivo adecuado puede proporcionar importantes beneficios:<\/p>\n<ol>\n<li>Tiempo de lectura m\u00e1s r\u00e1pido.<\/li>\n<li>Tiempo de escritura m\u00e1s r\u00e1pido.<\/li>\n<li>Archivos compartibles.<\/li>\n<li>Soporte para la evoluci\u00f3n de esquemas.<\/li>\n<li>Soporte avanzado para compresi\u00f3n.<\/li>\n<\/ol>\n<p>\nAlgunos formatos de archivo est\u00e1n dise\u00f1ados para uso general, otros para variantes m\u00e1s espec\u00edficas, y algunos han sido desarrollados teniendo en cuenta caracter\u00edsticas de datos concretas. As\u00ed que la elecci\u00f3n es realmente bastante amplia.<\/p>\n<h2>El formato de archivo Avro<\/h2>\n<p>\nPara <i>de serializaci\u00f3n de datos <\/i>es ampliamente utilizado; Avro es un <i>formato de almacenamiento de datos basado en filas<\/i>, lo que significa que es de tipo fila, en Hadoop. Almacena el esquema en formato JSON, facilitando su lectura e interpretaci\u00f3n por cualquier programa. Los propios datos se encuentran en un formato binario, de manera compacta y eficiente.<\/p>\n<p>El sistema de serializaci\u00f3n Avro es neutral en cuanto a lenguajes. Los archivos pueden ser procesados por diferentes lenguajes, actualmente son C, C++, C#, Java, Python y Ruby.<\/p>\n<p>Una caracter\u00edstica clave de Avro es su s\u00f3lida compatibilidad con esquemas de datos que cambian con el tiempo, es decir, que evolucionan. Avro entiende los cambios en el esquema: eliminaci\u00f3n, adici\u00f3n o modificaci\u00f3n de campos.<\/p>\n<p>Avro soporta una variedad de estructuras de datos. Por ejemplo, se puede crear un registro que contenga un array, un tipo enumerado y un subregistro.<\/p>\n<p><img decoding=\"async\" alt=\"Formatos de archivos en grandes datos: breve introducci\u00f3n\" src=\"\/wp-content\/uploads\/2020\/06\/9bf044329ac0980a48a125c505dee265.png\" style=\"display:block;margin: 0 auto;\" \/><br \/>\nEste formato es ideal para la escritura en la zona de aterrizaje (transitoria) de un lago de datos (<noindex><a rel=\"nofollow\" href=\"https:\/\/mcs.mail.ru\/blog\/chto-takoe-ozera-dannyh-i-zachem-tam-hranyat-big-data\">lago de datos<\/a><\/noindex>, o data lake \u2014 una colecci\u00f3n de instancias para almacenar varios tipos de datos, adem\u00e1s de las fuentes de datos directamente. <\/p>\n<p>As\u00ed que, para escribir en la zona de aterrizaje del lago de datos, este formato es el m\u00e1s adecuado por las siguientes razones:<\/p>\n<ol>\n<li>Los datos de esta zona generalmente se leen en su totalidad para un procesamiento posterior por parte de sistemas inferiores, y el formato basado en filas es m\u00e1s eficiente en este caso.<\/li>\n<li>Los sistemas inferiores pueden extraer f\u00e1cilmente tablas de esquemas de los archivos; no es necesario almacenar los esquemas por separado en un almacenamiento de metadatos externo.<\/li>\n<li>Cualquier cambio en el esquema original se maneja f\u00e1cilmente (evoluci\u00f3n del esquema).<\/li>\n<\/ol>\n<p><\/p>\n<h2>Formato de archivos Parquet<\/h2>\n<p>\nParquet es un formato de archivo de c\u00f3digo abierto para Hadoop que almacena <i>estructuras de datos anidadas en un formato de columnas plano<\/i>.<\/p>\n<p>En comparaci\u00f3n con el enfoque tradicional en filas, Parquet es m\u00e1s eficiente en t\u00e9rminos de almacenamiento y rendimiento.<\/p>\n<p>Esto es especialmente \u00fatil para consultas que leen ciertas columnas de una tabla amplia (con muchas columnas). Con el formato de archivos, solo se leen las columnas necesarias, minimizando as\u00ed la entrada\/salida.<\/p>\n<p><strong>Peque\u00f1a aclaraci\u00f3n<\/strong>: para comprender mejor el formato de archivo Parquet en Hadoop, veamos qu\u00e9 es un formato basado en columnas, es decir, formato columnar. En este formato, se almacenan juntos los valores del mismo tipo de cada columna. <\/p>\n<p><noindex><a rel=\"nofollow\" href=\"http:\/\/netjs.blogspot.com\/\">Por ejemplo,<\/a><\/noindex>, la entrada incluye los campos ID, Name y Department. En este caso, todos los valores de la columna ID se almacenar\u00e1n juntos, al igual que los valores de la columna Name y as\u00ed sucesivamente. La tabla tendr\u00e1 un aspecto similar al siguiente:<\/p>\n<p><strong>ID<\/strong><br \/>\n<strong>Nombre<\/strong><br \/>\n<strong>Departamento<\/strong><\/p>\n<p>1<br \/>\nemp1<br \/>\nd1<\/p>\n<p>2<br \/>\nemp2<br \/>\nd2<\/p>\n<p>3<br \/>\nemp3<br \/>\nd3<\/p>\n<p>\nEn formato de filas, los datos se guardar\u00e1n de la siguiente manera:<\/p>\n<p>1<br \/>\nemp1<br \/>\nd1<br \/>\n2<br \/>\nemp2<br \/>\nd2<br \/>\n3<br \/>\nemp3<br \/>\nd3<\/p>\n<p>\nEn el formato de columnas, los mismos datos se guardar\u00e1n as\u00ed:<\/p>\n<p>1<br \/>\n2<br \/>\n3<br \/>\nemp1<br \/>\nemp2<br \/>\nemp3<br \/>\nd1<br \/>\nd2<br \/>\nd3<\/p>\n<p>\nEl formato columnar es m\u00e1s eficiente cuando necesitas consultar varias columnas de una tabla. Solo lee las columnas necesarias, ya que est\u00e1n juntas. As\u00ed, las operaciones de entrada\/salida se minimizan.<\/p>\n<p>Por ejemplo, solo necesitas la columna NAME. En<noindex><a rel=\"nofollow\" href=\"http:\/\/netjs.blogspot.com\/\"> formato de filas<\/a><\/noindex> cada registro en el conjunto de datos necesita ser cargado, desglosado por campos y luego extraer los datos NAME. El formato columnar permite acceder directamente a la columna Name, ya que todos los valores para esa columna se almacenan juntos. No es necesario escanear todo el registro.<\/p>\n<p>De este modo, el formato de columnas aumenta el rendimiento de las consultas, ya que se necesita menos tiempo de b\u00fasqueda para acceder a las columnas requeridas y se reduce la cantidad de operaciones de entrada\/salida, dado que se leen solo las columnas necesarias.<\/p>\n<p>Una de las caracter\u00edsticas \u00fanicas<noindex><a rel=\"nofollow\" href=\"http:\/\/netjs.blogspot.com\/\"> Parquet<\/a><\/noindex> es que en este formato puede <i>almacenar datos con estructuras anidadas<\/i>. Esto significa que en el archivo Parquet incluso se pueden leer por separado los campos anidados sin necesidad de leer todos los campos de la estructura anidada. Para almacenar estructuras anidadas, Parquet utiliza el algoritmo de fragmentaci\u00f3n y ensamblaje (shredding and assembly).<\/p>\n<p><img decoding=\"async\" alt=\"Formatos de archivos en grandes datos: breve introducci\u00f3n\" src=\"\/wp-content\/uploads\/2020\/06\/8cba9a4faccc4bac7c5bbc3eec163a3c.png\" style=\"display:block;margin: 0 auto;\" \/><br \/>\nPara entender el formato de archivo Parquet en Hadoop, es necesario conocer los siguientes t\u00e9rminos:<\/p>\n<ol>\n<li><strong>Grupo de filas<\/strong> (row group): divisi\u00f3n l\u00f3gica horizontal de los datos en filas. Un grupo de filas consiste en un fragmento de cada columna en el conjunto de datos.<\/li>\n<li><strong>Fragmento de columna<\/strong> (column chunk): fragmento espec\u00edfico de una columna. Estos fragmentos de columnas residen en un grupo de filas determinado y estar\u00e1n garantizados como contiguos en el archivo.<\/li>\n<li><strong>P\u00e1gina<\/strong> (page): los fragmentos de columnas se dividen en p\u00e1ginas, escritas secuencialmente. Las p\u00e1ginas tienen un encabezado com\u00fan, por lo que se pueden omitir las innecesarias al leer.<\/li>\n<\/ol>\n<p>\n<img decoding=\"async\" alt=\"Formatos de archivos en grandes datos: breve introducci\u00f3n\" src=\"\/wp-content\/uploads\/2020\/06\/0f3d583bc2f07b6fef8430f10433cc14.png\" style=\"display:block;margin: 0 auto;\" \/><br \/>\nAqu\u00ed el encabezado simplemente contiene un n\u00famero m\u00e1gico <i>PAR1<\/i> (4 bytes), que identifica el archivo como un archivo del formato Parquet.<\/p>\n<p>En el pie de p\u00e1gina se registra lo siguiente:<\/p>\n<ol>\n<li>Metadatos del archivo, que contienen las coordenadas iniciales de los metadatos de cada columna. Al leer, primero se deben leer los metadatos del archivo para encontrar todos los fragmentos de columnas de inter\u00e9s. Luego, los fragmentos de columnas deben ser le\u00eddos secuencialmente. Adem\u00e1s, los metadatos incluyen la versi\u00f3n del formato, el esquema y cualquier par clave-valor adicional.<\/li>\n<li>Longitud de los metadatos (4 bytes).<\/li>\n<li>N\u00famero m\u00e1gico <i>PAR1<\/i> (4 bytes).<\/li>\n<\/ol>\n<p><\/p>\n<h2>El formato de archivos ORC<\/h2>\n<p>\n<i>es un formato de archivo optimizado por filas y columnas<\/i> (Optimized Row Columnar, <noindex><a rel=\"nofollow\" href=\"https:\/\/orc.apache.org\/\">ORC<\/a><\/noindex>) ofrece una forma muy eficiente de almacenar datos y fue desarrollado para superar las limitaciones de otros formatos. Almacena datos en una forma perfectamente compacta, permitiendo omitir detalles innecesarios, sin la necesidad de construir \u00edndices grandes, complejos o mantenidos manualmente. <\/p>\n<p>Ventajas del formato ORC:<\/p>\n<ol>\n<li>Un archivo de salida por cada tarea, lo que reduce la carga en el NameNode.<\/li>\n<li>Soporte para tipos de datos de Hive, incluyendo DateTime, tipos decimales y tipos complejos (struct, list, map y union).<\/li>\n<li>Lectura simult\u00e1nea del mismo archivo por diferentes procesos de RecordReader.<\/li>\n<li>Capacidad de dividir archivos sin escanear en busca de marcadores.<\/li>\n<li>Estimaci\u00f3n de la m\u00e1xima asignaci\u00f3n de memoria heap para procesos de lectura\/escritura seg\u00fan la informaci\u00f3n en el pie de p\u00e1gina del archivo.<\/li>\n<li>Los metadatos se almacenan en un formato binario de serializaci\u00f3n de Protocol Buffers, que permite agregar y eliminar campos.<\/li>\n<\/ol>\n<p>\n<img decoding=\"async\" alt=\"Formatos de archivos en grandes datos: breve introducci\u00f3n\" src=\"\/wp-content\/uploads\/2020\/06\/342a51df1730398d5280484407461d8c.png\" style=\"display:block;margin: 0 auto;\" \/><br \/>\nORC almacena colecciones de filas en un solo archivo, y dentro de la colecci\u00f3n, los datos de fila se almacenan en formato columnar.<\/p>\n<p>Un archivo ORC almacena grupos de filas, conocidos como stripes, y la informaci\u00f3n auxiliar en el pie de p\u00e1gina del archivo. El postscript al final del archivo contiene par\u00e1metros de compresi\u00f3n y el tama\u00f1o del pie de p\u00e1gina comprimido.<\/p>\n<p>Por defecto, el tama\u00f1o de una stripe es de 250 MB. Gracias a stripes de este gran tama\u00f1o, la lectura desde HDFS se realiza de manera m\u00e1s eficiente: en grandes bloques continuos.<\/p>\n<p>El pie de p\u00e1gina del archivo registra una lista de stripes en el archivo, el n\u00famero de filas por stripe y el tipo de datos de cada columna. Tambi\u00e9n se registra el valor resultante de count, min, max y sum por cada columna.<\/p>\n<p>El pie de p\u00e1gina de la stripe contiene un cat\u00e1logo de ubicaciones de flujo.<\/p>\n<p>Los datos de fila se utilizan al escanear tablas.<\/p>\n<p>Los datos de \u00edndice incluyen valores m\u00ednimos y m\u00e1ximos para cada columna y la posici\u00f3n de las filas en cada columna. Los \u00edndices ORC solo se utilizan para seleccionar stripes y grupos de filas, no para responder consultas.<\/p>\n<h2>Comparaci\u00f3n de diferentes formatos de archivo.<\/h2>\n<p><\/p>\n<h3>Avro frente a Parquet.<\/h3>\n<p><\/p>\n<ol>\n<li>Avro es un formato de almacenamiento por filas, mientras que Parquet almacena datos por columnas.<\/li>\n<li>Parquet es m\u00e1s adecuado para consultas anal\u00edticas, es decir, las operaciones de lectura y consulta de datos son mucho m\u00e1s eficientes que las de escritura.<\/li>\n<li>Las operaciones de escritura en Avro se realizan de manera m\u00e1s eficiente que en Parquet.<\/li>\n<li>Avro maneja la evoluci\u00f3n de esquemas de forma m\u00e1s madura. Parquet solo admite la adici\u00f3n de esquemas, mientras que Avro implementa una evoluci\u00f3n multifuncional, es decir, la adici\u00f3n o modificaci\u00f3n de columnas.<\/li>\n<li>Parquet es ideal para consultar subconjuntos de columnas en una tabla de m\u00faltiples columnas. Avro es adecuado para operaciones ETL, donde consultamos todas las columnas.<\/li>\n<\/ol>\n<p><\/p>\n<h3>ORC frente a Parquet.<\/h3>\n<p><\/p>\n<ol>\n<li>Parquet almacena mejor los datos anidados.<\/li>\n<li>ORC est\u00e1 mejor adaptado para el empuje de predicados (predicate pushdown).<\/li>\n<li>ORC admite propiedades ACID.<\/li>\n<li>ORC comprime mejor los datos.<\/li>\n<\/ol>\n<p>\n<strong>Lecturas adicionales sobre el tema<\/strong>:<\/p>\n<ol>\n<li><noindex><a rel=\"nofollow\" href=\"https:\/\/mcs.mail.ru\/blog\/analiz-bolshih-dannyh-v-oblake\">An\u00e1lisis de grandes datos en la nube: c\u00f3mo las empresas pueden volverse orientadas a los datos<\/a><\/noindex>.<\/li>\n<li><noindex><a rel=\"nofollow\" href=\"https:\/\/habr.com\/ru\/company\/mailru\/blog\/501598\/\">Gu\u00eda sencilla sobre esquemas de bases de datos<\/a><\/noindex>.<\/li>\n<li><noindex><a rel=\"nofollow\" href=\"https:\/\/tele.click\/zavtra_oblachno\">Nuestro canal de Telegram sobre transformaci\u00f3n digital<\/a><\/noindex>. \n<\/li>\n<\/ol>\n<p>Fuente: <a content=\"nofollow\" rel=\"nofollow\" href=\"https:\/\/habr.com\/ru\/company\/mailru\/blog\/504952\/\">habr.com<\/a> <\/p>","protected":false,"gt_translate_keys":[{"key":"rendered","format":"html"}]},"excerpt":{"rendered":"<p>Weather Deity by Remarin \u041a\u043e\u043c\u0430\u043d\u0434\u0430 Mail.ru Cloud Solutions \u043f\u0440\u0435\u0434\u043b\u0430\u0433\u0430\u0435\u0442 \u043f\u0435\u0440\u0435\u0432\u043e\u0434 \u0441\u0442\u0430\u0442\u044c\u0438 \u0438\u043d\u0436\u0435\u043d\u0435\u0440\u0430 \u0420\u0430\u0445\u0443\u043b\u0430 \u0411\u0445\u0430\u0442\u0438\u0438 \u0438\u0437 \u043a\u043e\u043c\u043f\u0430\u043d\u0438\u0438 Clairvoyant \u043e \u0442\u043e\u043c, \u043a\u0430\u043a\u0438\u0435 \u0435\u0441\u0442\u044c \u0444\u043e\u0440\u043c\u0430\u0442\u044b \u0444\u0430\u0439\u043b\u043e\u0432 \u0432 \u0431\u043e\u043b\u044c\u0448\u0438\u0445 \u0434\u0430\u043d\u043d\u044b\u0445, \u043a\u0430\u043a\u0438\u0435 \u0441\u0430\u043c\u044b\u0435 \u0440\u0430\u0441\u043f\u0440\u043e\u0441\u0442\u0440\u0430\u043d\u0435\u043d\u043d\u044b\u0435 \u0444\u0443\u043d\u043a\u0446\u0438\u0438 \u0444\u043e\u0440\u043c\u0430\u0442\u043e\u0432 Hadoop \u0438 \u043a\u0430\u043a\u043e\u0439 \u0444\u043e\u0440\u043c\u0430\u0442 \u043b\u0443\u0447\u0448\u0435 \u0438\u0441\u043f\u043e\u043b\u044c\u0437\u043e\u0432\u0430\u0442\u044c. \u0417\u0430\u0447\u0435\u043c \u043d\u0443\u0436\u043d\u044b \u0440\u0430\u0437\u043d\u044b\u0435 \u0444\u043e\u0440\u043c\u0430\u0442\u044b \u0444\u0430\u0439\u043b\u043e\u0432 \u0421\u0435\u0440\u044c\u0435\u0437\u043d\u043e\u0435 \u0443\u0437\u043a\u043e\u0435 \u043c\u0435\u0441\u0442\u043e \u0432 \u043f\u0440\u043e\u0438\u0437\u0432\u043e\u0434\u0438\u0442\u0435\u043b\u044c\u043d\u043e\u0441\u0442\u0438 \u043f\u0440\u0438\u043b\u043e\u0436\u0435\u043d\u0438\u0439 \u0441 \u043f\u043e\u0434\u0434\u0435\u0440\u0436\u043a\u043e\u0439 HDFS, \u0442\u0430\u043a\u0438\u0445 \u043a\u0430\u043a MapReduce \u0438 [&hellip;]<\/p>\n","protected":false,"gt_translate_keys":[{"key":"rendered","format":"html"}]},"author":1,"featured_media":84417,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[688],"tags":[],"class_list":["post-84416","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-administrirovanie"],"aioseo_notices":[],"aioseo_head":"\n\t\t<!-- All in One SEO 5.0.2 - aioseo.com -->\n\t<meta name=\"robots\" content=\"max-image-preview:large\" \/>\n\t<meta name=\"author\" content=\"Yuri Gagarin\"\/>\n\t<link rel=\"canonical\" href=\"https:\/\/prohoster.info\/es\/blog\/administrirovanie\/formaty-fajlov-v-bolshih-dannyh-kratkij-likbez\" \/>\n\t<meta name=\"generator\" content=\"All in One SEO (AIOSEO) 5.0.2\" \/>\n\t\t<meta property=\"og:locale\" content=\"es_ES\" \/>\n\t\t<meta property=\"og:site_name\" content=\"ProHoster | \u041a\u0443\u043f\u0438\u0442\u044c \u043d\u0430\u0434\u0435\u0436\u043d\u044b\u0439 \u0445\u043e\u0441\u0442\u0438\u043d\u0433 \u0434\u043b\u044f \u0441\u0430\u0439\u0442\u043e\u0432 \u0441 \u0437\u0430\u0449\u0438\u0442\u043e\u0439 \u043e\u0442 DDoS, VPS VDS \u0441\u0435\u0440\u0432\u0435\u0440\u044b\" \/>\n\t\t<meta property=\"og:type\" content=\"article\" \/>\n\t\t<meta property=\"og:title\" content=\"\ud83e\udd47\u0424\u043e\u0440\u043c\u0430\u0442\u044b \u0444\u0430\u0439\u043b\u043e\u0432 \u0432 \u0431\u043e\u043b\u044c\u0448\u0438\u0445 \u0434\u0430\u043d\u043d\u044b\u0445: \u043a\u0440\u0430\u0442\u043a\u0438\u0439 \u043b\u0438\u043a\u0431\u0435\u0437 | ProHoster\" \/>\n\t\t<meta property=\"og:url\" content=\"https:\/\/prohoster.info\/es\/blog\/administrirovanie\/formaty-fajlov-v-bolshih-dannyh-kratkij-likbez\" \/>\n\t\t<meta property=\"og:image\" content=\"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg\" \/>\n\t\t<meta property=\"og:image:secure_url\" content=\"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg\" \/>\n\t\t<meta property=\"og:image:width\" content=\"350\" \/>\n\t\t<meta property=\"og:image:height\" content=\"350\" \/>\n\t\t<meta property=\"article:published_time\" content=\"2020-06-07T11:42:50+00:00\" \/>\n\t\t<meta property=\"article:modified_time\" content=\"2020-06-07T11:42:50+00:00\" \/>\n\t\t<meta property=\"article:publisher\" content=\"https:\/\/www.facebook.com\/prohoster\" \/>\n\t\t<meta property=\"article:author\" content=\"https:\/\/www.facebook.com\/prohoster\" \/>\n\t\t<!-- All in One SEO -->\n\n","aioseo_head_json":{"title":"\ud83e\udd47Formatos de archivos en grandes datos: breve gu\u00eda | ProHoster","description":"","canonical_url":"https:\/\/prohoster.info\/es\/blog\/administrirovanie\/formaty-fajlov-v-bolshih-dannyh-kratkij-likbez","robots":"max-image-preview:large","keywords":"","webmasterTools":{"miscellaneous":""},"schema":null,"og:locale":"es_ES","og:site_name":"ProHoster | \u041a\u0443\u043f\u0438\u0442\u044c \u043d\u0430\u0434\u0435\u0436\u043d\u044b\u0439 \u0445\u043e\u0441\u0442\u0438\u043d\u0433 \u0434\u043b\u044f \u0441\u0430\u0439\u0442\u043e\u0432 \u0441 \u0437\u0430\u0449\u0438\u0442\u043e\u0439 \u043e\u0442 DDoS, VPS VDS \u0441\u0435\u0440\u0432\u0435\u0440\u044b","og:type":"article","og:title":"\ud83e\udd47\u0424\u043e\u0440\u043c\u0430\u0442\u044b \u0444\u0430\u0439\u043b\u043e\u0432 \u0432 \u0431\u043e\u043b\u044c\u0448\u0438\u0445 \u0434\u0430\u043d\u043d\u044b\u0445: \u043a\u0440\u0430\u0442\u043a\u0438\u0439 \u043b\u0438\u043a\u0431\u0435\u0437 | ProHoster","og:url":"https:\/\/prohoster.info\/es\/blog\/administrirovanie\/formaty-fajlov-v-bolshih-dannyh-kratkij-likbez","og:image":"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg","og:image:secure_url":"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg","og:image:width":350,"og:image:height":350,"article:published_time":"2020-06-07T11:42:50+00:00","article:modified_time":"2020-06-07T11:42:50+00:00","article:publisher":"https:\/\/www.facebook.com\/prohoster","article:author":"https:\/\/www.facebook.com\/prohoster"},"aioseo_meta_data":{"post_id":"84416","title":null,"description":null,"keywords":null,"keyphrases":null,"primary_term":null,"canonical_url":null,"og_title":null,"og_description":null,"og_object_type":"default","og_image_type":"default","og_image_url":null,"og_image_width":null,"og_image_height":null,"og_image_custom_url":null,"og_image_custom_fields":null,"og_video":null,"og_custom_url":null,"og_article_section":null,"og_article_tags":null,"twitter_use_og":false,"twitter_card":"default","twitter_image_type":"default","twitter_image_url":null,"twitter_image_custom_url":null,"twitter_image_custom_fields":null,"twitter_title":null,"twitter_description":null,"schema":{"blockGraphs":[],"customGraphs":[],"default":{"data":{"Article":[],"Course":[],"Dataset":[],"FAQPage":[],"Movie":[],"Person":[],"Product":[],"ProductReview":[],"Car":[],"Recipe":[],"Service":[],"SoftwareApplication":[],"WebPage":[]},"graphName":"","isEnabled":true},"graphs":[]},"schema_type":null,"schema_type_options":null,"pillar_content":false,"robots_default":true,"robots_noindex":false,"robots_noarchive":false,"robots_nosnippet":false,"robots_nofollow":false,"robots_noimageindex":false,"robots_noodp":false,"robots_notranslate":false,"robots_max_snippet":null,"robots_max_videopreview":null,"robots_max_imagepreview":"large","priority":null,"frequency":null,"local_seo":null,"seo_analyzer_scan_date":null,"breadcrumb_settings":null,"limit_modified_date":false,"reviewed_by":null,"ai":null,"created":"2021-02-28 14:58:40","updated":"2022-09-28 08:24:46","focus_keyword":null,"additional_keywords":null,"truseo_locale":null},"gt_translate_keys":[{"key":"link","format":"url"}],"_links":{"self":[{"href":"https:\/\/prohoster.info\/es\/wp-json\/wp\/v2\/posts\/84416","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/prohoster.info\/es\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/prohoster.info\/es\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/prohoster.info\/es\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/prohoster.info\/es\/wp-json\/wp\/v2\/comments?post=84416"}],"version-history":[{"count":0,"href":"https:\/\/prohoster.info\/es\/wp-json\/wp\/v2\/posts\/84416\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/prohoster.info\/es\/wp-json\/wp\/v2\/media\/84417"}],"wp:attachment":[{"href":"https:\/\/prohoster.info\/es\/wp-json\/wp\/v2\/media?parent=84416"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/prohoster.info\/es\/wp-json\/wp\/v2\/categories?post=84416"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/prohoster.info\/es\/wp-json\/wp\/v2\/tags?post=84416"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}