Релиз на платформата за разпределена обработка на данни Apache Hadoop 3.3

След една година и половина разработка, организацията Apache Software Foundation е публикувала релиз Apache Hadoop 3.3.0, свободна платформа за организиране на разпределена обработка на големи обеми данни с използването на парадигмата map/reduce, при която задачата се разделя на множество по-малки, независими фрагменти, всеки от които може да бъде изпълнен на отделен узел от клъстера. Хранилището, базирано на Hadoop, може да обхваща хиляди узли и да съдържа ексабайти данни.

Hadoop включва реализация на разпределената файлова система Hadoop Distributed Filesystem (HDFS), която автоматично осигурява резервиране на данни и е оптимизирана за работа с MapReduce приложения. За улеснение на достъпа до данните в хранилището на Hadoop е разработена база данни HBase и SQL-подобен език Pig, който представлява своеобразен SQL за MapReduce, чиито заявки могат да бъдат паралелизирани и обработвани от няколко Hadoop платформи. Проектът се оценява като напълно стабилен и готов за промишлена експлоатация. Hadoop се използва активно в големи индустриални проекти, предоставяйки възможности, подобни на платформата Google Bigtable/GFS/MapReduce, като същевременно компанията Google официално делегирала Hadoop и на други проекти на Apache правото да използват технологии, покрити от патенти, свързани с метода MapReduce.

Hadoop заема първо място сред хранилищата на Apache по брой внесени промени и пето място по размер на кодовата база (около 4 милиона реда код). Сред големите внедрения на Hadoop се открояват хранилищата на Netflix (съхраняват се над 500 милиарда събития на ден), Twitter (клъстер от 10 хиляди узла в реално време съхранява над зетабайта данни и обработва над 5 милиарда сесии на ден), Facebook (клъстер от 4 хиляди узла съхранява над 300 петабайта и ежедневно нараства с 4 ПБ).

Основни промени в Apache Hadoop 3.3:

  • Добавена е поддръжка за платформи, основани на архитектура ARM.
  • Реализацията на формата Protobuf (Protocol buffers), използван за сериализация на структурирани данни, е актуализирана до версия 3.7.1 поради приключването на жизнения цикъл на версия прототип-2.5.0.
  • Разширени са възможностите на конектора S3A: добавена е поддръжка за аутентификация с токени (Delegation Token), подобрена е поддръжката за кеширане на отговори с код 404, повишена е производителността на S3guard и увеличена надеждността на работата.
  • В файловата система ABFS са разрешени проблемите с автоматичната настройка.
  • Добавена е вградена поддръжка за файловата система Tencent Cloud COS за достъп до обектното хранилище COS.
  • Добавена е пълна поддръжка за Java 11.
  • Стабилизирана е реализацията на HDFS RBF (Federation на базата на Router). В HDFS Router са добавени средства за управление на сигурността.
  • Добавен е сервис за DNS резолюция, който позволява на клиентите да установяват връзка със сървъри чрез DNS по имената на узлите, без да е необходимо изброяване на всички хостове в настройките.
  • Добавена е поддръжка за планиране на стартиране на опортюнистични контейнери чрез централизирания ресурсен мениджър (ResourceManager), включително възможност за разпределение на контейнерите в зависимост от натоварването на всеки узел.
  • Добавен е каталог на приложения YARN (Yet Another Resource Negotiator) с възможност за търсене.

Източник: opennet.ru

Купете надежден хостинг за сайтове с защита от DDoS, VPS VDS сървъри 🔥 Купете надежден хостинг за сайтове с защита от DDoS, VPS VDS сървъри | ProHoster