Релиз на платформата за разпределена обработка на данни Apache Hadoop 3.3

След година и половина разработки, организация Apache Software Foundation публикува релиз Apache Hadoop 3.3.0, свободна платформа за организиране на разпределена обработка на големи обеми данни, използваща парадигмата map/reduce, при която задачата се разделя на множество по-малки независими фрагменти, всеки от които може да бъде изпълнен на отделен възел от клъстера. Хранилището на базата на Hadoop може да обхваща хиляди възли и да съдържа ексабайти данни.

Включва имплементация на разпределената файлова система Hadoop Distributed Filesystem (HDFS), която автоматично осигурява резервиране на данни и е оптимизирана за работа с MapReduce приложения. За улесняване на достъпа до данни в хранилището на Hadoop е разработена БД HBase и SQL-подобен език Pig, който е своеобразен SQL за MapReduce, чийто заявки могат да бъдат паралелизирани и обработвани на няколко Hadoop платформи. Проектът се оценява като напълно стабилен и готов за индустриално експлоатиране. Hadoop активно се използва в големи индустриални проекти, предоставяйки възможности, подобни на платформите на Google Bigtable/GFS/MapReduce, като компанията Google официално делегира Hadoop и други проекти на Apache правото да използват технологии, обхванати от патенти, свързани с метода MapReduce.

Hadoop заема първо място сред хранилищата на Apache по брой направени промени и пето място по размер на кодовата база (около 4 милиона реда код). Сред големите внедрявания на Hadoop могат да се отбележат хранилищата на Netflix (съхраняващи над 500 милиарда събития на ден), Twitter (клъстер от 10 хиляди възли в реално време съхранява повече от зетабайт данни и обработва над 5 милиарда сесии на ден), Facebook (клъстер от 4 хиляди възли съхранява над 300 петабайта и нараства с 4 ПБ на ден).

Основни промени в Apache Hadoop 3.3:

  • Добавена е поддръжка за платформи, базирани на архитектурата ARM.
  • Имплементацията на формата Protobuf (Протоколни буфери), използвани за сериализация на структурирани данни, е обновена до версия 3.7.1 поради края на жизнения цикъл на клона protobuf-2.5.0.
  • Разширени са възможностите на конектора S3A: добавена е поддръжка за удостоверяване чрез токени (Delegation Token), подобрена е поддръжката на кеширането на отговори с код 404, увеличена е производителността на S3guard и повишена надеждността на работата.
  • В ABFS файловата система са разрешени проблемите с автоматичното настройване.
  • Добавена е вградена поддръжка на файловата система Tencent Cloud COS за достъп до обектното хранилище COS.
  • Добавена е пълна поддръжка за Java 11.
  • Стабилизирана е реализацията на HDFS RBF (Router-based Federation). В HDFS Router са добавени средства за управление на сигурността.
  • Добавена е услуга за DNS Resolution за определяне на сървърите от клиента чрез DNS по имената на възлите, позволяваща да се избегне изброяването на всички хостове в настройките.
  • Добавена е поддръжка за планиране на стартиране на оппортунистични контейнери чрез централизирания мениджър на ресурси (ResourceManager), включително възможността за разпределение на контейнерите в зависимост от натоварването на всеки възел.
  • Добавен е каталог на приложенията YARN (Yet Another Resource Negotiator) с възможност за търсене.

Източник: opennet.ru

Купете надежден хостинг за сайтове със защита от DDoS, VPS и VDS сървъри 🔥 Купете надежден хостинг за сайтове със защита от DDoS, VPS и VDS сървъри | ProHoster