След една година и половина разработка, организацията Apache Software Foundation релиз , свободна платформа за организиране на разпределена обработка на големи обеми данни с използването на парадигмата , при която задачата се разделя на множество по-малки, независими фрагменти, всеки от които може да бъде изпълнен на отделен узел от клъстера. Хранилището, базирано на Hadoop, може да обхваща хиляди узли и да съдържа ексабайти данни.
Hadoop включва реализация на разпределената файлова система Hadoop Distributed Filesystem (HDFS), която автоматично осигурява резервиране на данни и е оптимизирана за работа с MapReduce приложения. За улеснение на достъпа до данните в хранилището на Hadoop е разработена база данни HBase и SQL-подобен език Pig, който представлява своеобразен SQL за MapReduce, чиито заявки могат да бъдат паралелизирани и обработвани от няколко Hadoop платформи. Проектът се оценява като напълно стабилен и готов за промишлена експлоатация. Hadoop се използва активно в големи индустриални проекти, предоставяйки възможности, подобни на платформата Google Bigtable/GFS/MapReduce, като същевременно компанията Google официално Hadoop и на други проекти на Apache правото да използват технологии, покрити от патенти, свързани с метода MapReduce.
Hadoop заема първо място сред хранилищата на Apache по брой внесени промени и пето място по размер на кодовата база (около 4 милиона реда код). Сред големите внедрения на Hadoop се открояват хранилищата на Netflix (съхраняват се над 500 милиарда събития на ден), Twitter (клъстер от 10 хиляди узла в реално време съхранява над зетабайта данни и обработва над 5 милиарда сесии на ден), Facebook (клъстер от 4 хиляди узла съхранява над 300 петабайта и ежедневно нараства с 4 ПБ).
Основни в Apache Hadoop 3.3:
- Добавена е поддръжка за платформи, основани на архитектура ARM.
- Реализацията на формата (Protocol buffers), използван за сериализация на структурирани данни, е актуализирана до версия 3.7.1 поради приключването на жизнения цикъл на версия прототип-2.5.0.
- Разширени са възможностите на конектора S3A: добавена е поддръжка за аутентификация с токени (), подобрена е поддръжката за кеширане на отговори с код 404, повишена е производителността на S3guard и увеличена надеждността на работата.
- В файловата система ABFS са разрешени проблемите с автоматичната настройка.
- Добавена е вградена поддръжка за файловата система Tencent Cloud COS за достъп до обектното хранилище COS.
- Добавена е пълна поддръжка за Java 11.
- Стабилизирана е реализацията на HDFS RBF (Federation на базата на Router). В HDFS Router са добавени средства за управление на сигурността.
- Добавен е сервис за DNS резолюция, който позволява на клиентите да установяват връзка със сървъри чрез DNS по имената на узлите, без да е необходимо изброяване на всички хостове в настройките.
- Добавена е поддръжка за планиране на стартиране чрез централизирания ресурсен мениджър (ResourceManager), включително възможност за разпределение на контейнерите в зависимост от натоварването на всеки узел.
- Добавен е каталог на приложения YARN (Yet Another Resource Negotiator) с възможност за търсене.
Източник: opennet.ru
