Проектът Open Data Hub – отворена платформа за машинно обучение на база Red Hat OpenShift.

Бъдещето е тук, технологии за изкуствен интелект и машинно обучение вече успешно се използват от любимите ви магазини, транспортни компании и дори ферми, отглеждащи пуяци.

Проектът Open Data Hub – отворена платформа за машинно обучение на база Red Hat OpenShift.

Ако нещо съществува, значи в интернет вече има… открит проект! Вижте как Open Data Hub помага за мащабиране на нови технологии и избягване на трудности при тяхното внедряване.

При всички плюсове на изкуствения интелект (artificial Intelligence, AI) и машинното обучение (machine learning, ML), организациите често срещат трудности с мащабирането на тези технологии. Основните проблеми при това обикновено са следните:

  • Обмен на информация и сътрудничество – обменът на информация без излишни усилия и сътрудничеството в режим на бързи итерации практически е невъзможен.
  • Достъп до данни – за всяка задача е необходимо да се изгражда отново и на ръка, което отнема много време.
  • Достъп при поискване – липсва възможност за получаване на on-demand достъп до инструментите и платформата за машинно обучение, както и до изчислителната инфраструктура.
  • Продакшън – моделите остават на етап прототип и не достигат до промишлена експлоатация.
  • Проследяване и обяснение на резултатите от AI – възпроизводимостта, проследяването и обяснението на резултатите от AI/ML са затруднени.

Оставени без решение, тези проблеми негативно влияят на скоростта, ефективността и производителността на ценни специалисти по обработка и анализ на данни. Това води до фрустрация, разочарование в работата, а в крайна сметка очакванията на бизнеса относно AI/ML се провалят.

Отговорността за решаването на тези проблеми лежи на ИТ специалистите, които трябва да предоставят на дата-аналитиците – правилно, нещо като облак. Ако се разшири, необходима е такава платформа, която да предоставя свобода на избор и да има удобен, лесен достъп. В същото време тя да е бърза, лесно да се пренастройва, да се мащабира по искане и да е устойчива на откази. Изграждането на такава платформа на база технологии с отворен код помага да не попаднете в зависимост от доставчика и да запазите дългосрочно стратегическо предимство по отношение на контролиране на разходите.

Преди няколко години подобно нещо се случваше в разработката на приложения и доведе до появата на микросервизи, хибридни облачни среди, ИТ автоматизация и agile процеси. За да се справят с всичко това, ИТ специалистите започнаха да използват контейнери, Kubernetes и отворени хибридни облаци.

Сега този опит се прилага за отговор на предизвикателствата на AI. Затова ИТ специалистите създават платформи, базирани на контейнери, които позволяват разработването на AI/ML услуги в контекста на agile процеси, ускоряват иновациите и са насочени към хибридно облачно решение.

Проектът Open Data Hub – отворена платформа за машинно обучение на база Red Hat OpenShift.

Изграждането на такава платформа ще започнем с Red Hat OpenShift, нашата контейнерна Kubernetes платформа за хибридно облако, която разполага с бързо разрастваща се екосистема от софтуерни и хардуерни ML решения (NVIDIA, H2O.ai, Starburst, PerceptiLabs и др.). Някои от клиентите на Red Hat, като BMW Group, ExxonMobil и други, вече са внедрили контейнеризирани ML инструменти и DevOps процеси върху тази платформа и нейната екосистема, за да приведат своите ML архитектури в индустриална експлоатация и да ускорят работата на дата анализаторите.

Още една причина, поради която стартирахме проекта Open Data Hub, е да демонстрираме примерна архитектура на базата на няколко отворени софтуерни проекта и да покажем как да се реализира целият жизнен цикъл на ML решение на базата на платформата OpenShift.

Проект Open Data Hub

Това е проект с отворен код, който се развива в рамките на съответната разработваща общност и реализира пълния цикъл на операции – от качване и преобразуване на входни данни до формиране, обучение и поддръжка на модела – при решаване на AI/ML задачи с помощта на контейнери и Kubernetes на платформата OpenShift. Този проект може да се разглежда като референтна реализация, пример за това как да се построи отворено решение от клас „AI/ML като услуга“ на базата на OpenShift и съответните инструменти с отворен код, като Tensorflow, JupyterHub, Spark и други. Важно е да се отбележи, че Red Hat самата използва този проект, за да предоставя своите AI/ML услуги. Освен това, OpenShift интегрира ключови софтуерни и хардуерни ML решения от NVIDIA, Seldon, Starburst и други вендори, което улеснява изграждането и стартирането на собствени системи за машинно обучение.

Проектът Open Data Hub – отворена платформа за машинно обучение на база Red Hat OpenShift.

Проект Open Data Hub е насочен към следните категории потребители и сценарии на използване:

  • Дата аналитик, който се нуждае от облачно решение за реализиране на ML проекти с функции за самообслужване.
  • Дата аналитик, който иска максимален избор от разнородни нови AI/ML инструменти и платформи с отворен код.
  • Дата аналитик, на когото е необходим достъп до източниците на данни при обучението на модели.
  • Дата аналитик, на когото са нужни изчислителни ресурси (CPU, GPU, памет).
  • Дата аналитик, който изисква възможност за сътрудничество и обмен на резултати с колеги, получаване на обратна връзка и внедряване на подобрения чрез бързи итерации.
  • Дата аналитик, който иска да взаимодейства с разработчици (и devops екипи), за да постави своите ML модели и резултати в продукция.
  • Инженер по данни, който трябва да осигури на дата аналитика достъп до разнообразни източници на данни с спазване на норми и изисквания за сигурност.
  • Администратор/оператор на ИТ системи, който се нуждае от възможност лесно да контролира живота на (инсталация, конфигурация, актуализация) компоненти и технологии с отворен код. Също така са нужни съответните инструменти за управление и квотиране.

Проектът Open Data Hub обединява редица инструменти с отворен код за реализиране на целия цикъл на действия за AI/ML. Основният работен инструмент на дата аналитика тук е Jupyter Notebook. Тази платформа е много популярна сред специалисти по обработка и анализ на данни, а Open Data Hub им позволява лесно да създават и управляват работни пространства Jupyter Notebook, използвайки вградения JupyterHub. Освен създаване и импорт на Jupyter notebooks, проектът Open Data Hub включва и редица готови notebooks в библиотеката AI Library.

Тази библиотека представлява колекция от open-source компоненти за машинно обучение и решения за стандартни сценарии, които опростяват бързото прототипиране. JupyterHub е интегриран с RBAC модел на достъп OpenShift, което позволява използването на вече съществуващи акаунти в OpenShift и реализиране на единен вход в системата. Освен това, JupyterHub предлага удобен потребителски интерфейс, наречен spawner, чрез който потребителят може лесно да настрои обема изчислителни ресурси (процесорни ядра, памет, GPU) за избрания Jupyter Notebook.

След като данъчният аналитик създаде и настрои ноутбука, всички останали задължения по него поема Кубернетес планиращия, който е част от OpenShift. Потребителите просто изпълняват своите експерименти, запазват и споделят резултатите от своята работа. Освен това, напредналите потребители могат директно да се обръщат към CLI интерфейса на OpenShift от Jupyter notebooks, за да задействат Кубернетес примитиви, като Job, или функционалности на OpenShift, например Tekton или Knative. Може също така да се използва удобният GUI на OpenShift, наречен "веб-конзола на OpenShift".

Проектът Open Data Hub – отворена платформа за машинно обучение на база Red Hat OpenShift.

Проектът Open Data Hub – отворена платформа за машинно обучение на база Red Hat OpenShift.

Преминавайки към следващия етап, Open Data Hub предоставя възможност за управление на конвейери за данни (data pipelines). За това се използва Ceph обект, който е предоставен под формата на S3-съвместимо обектно хранилище на данни. Apache Spark осигурява стрийминг на данни от външни източници или вграденото хранилище Ceph S3 и позволява предварителни преобразувания на данните. Apache Kafka осигурява разширено управление на конвейерите за данни (където могат да се извършват многократни зареждания, а също така операции по преобразуване, анализ и съхранение на данни).

Така, данъчният аналитик получи достъп до данните и построи модела. Сега той иска да сподели получените резултати с колегите или разработчиците на приложения, като предостави своя модел на принципа на услугата. За това е нужен изходен сървър, а Open Data Hub разполага с такъв сървър, наречен Seldon, който позволява публикуването на модел като RESTful услуга.

В определен момент на сервере Seldon может появиться несколько таких моделей, и появляется необходимость в мониторинге их использования. Для этого Open Data Hub предлагает набор соответствующих метрик и движок отчетности, основанный на популярных инструментах мониторинга с открытым кодом Prometheus и Grafana. В итоге мы получаем обратную связь для наблюдения за применением AI-моделей, особенно в производственной среде.

Проектът Open Data Hub – отворена платформа за машинно обучение на база Red Hat OpenShift.

Таким образом, Open Data Hub предлагает облачный подход на протяжении всего цикла операций AI/ML, начиная от доступа и подготовки данных и заканчивая обучением и промышленной эксплуатацией модели.

Събираме всичко накуп

Теперь возникает вопрос, как всё это организовать администратору OpenShift. И здесь на помощь приходит специальный Kubernetes-оператор для проектов Open Data Hub.

Проектът Open Data Hub – отворена платформа за машинно обучение на база Red Hat OpenShift.

Этот оператор управляет установкой, настройкой и жизненным циклом проекта Open Data Hub, включая развертывание таких упомянутых инструментов, как JupyterHub, Ceph, Spark, Kafka, Seldon, Prometheus и Grafana. Проект Open Data Hub можно найти в веб-консоли OpenShift в разделе community-операторов. Таким образом, администратор OpenShift может определить, что соответствующие проекты OpenShift относятся к категории «проект Open Data Hub». Это делается один раз. После этого дата-аналитик через веб-консоль OpenShift входит в свое рабочее пространство и видит, что для его проектов установлен и доступен соответствующий Kubernetes-оператор. Затем он создает экземпляр проекта Open Data Hub одним щелчком мыши и сразу же получает доступ к упомянутым инструментам. И все это можно настроить в режиме высокой доступности и отказоустойчивости.

Проектът Open Data Hub – отворена платформа за машинно обучение на база Red Hat OpenShift.

Если вы хотите самостоятельно опробовать проект Open Data Hub, начните с инструкций по установке и вводного учебника. Технические детали архитектуры Open Data Hub можно найти тук, планы развития проекта – тук. В будущем планируется реализовать дополнительную интеграцию с Kubeflow, решить ряд вопросов, связанных с регулированием данных и безопасностью, а также организовать интеграцию с системами на основе правил Drools и Optaplanner. Выразить свое мнение и стать участником проекта Open Data Hub можно на странице сообщества.

Резюмираме: сериозни проблеми с мащабируемостта пречат на организациите да реализират напълно потенциала на изкуствения интелект и машинното обучение. Red Hat OpenShift отдавна и успешно се използва за решаване на подобни проблеми в софтуерната индустрия. Проектът Open Data Hub, реализиран в рамките на общност за разработка с отворен код, предлага еталонна архитектура за организиране на целия цикъл от операции AI/ML на базата на хибридно облако OpenShift. Имаме ясен и добре обмислен план за развитие на този проект и сме сериозно настроени да създадем активно и плодоносно общество за разработка на отворени AI решения на платформата OpenShift.

Източник: habr.com

Купете надежден хостинг за сайтове с защита от DDoS, VPS VDS сървъри 🔥 Купете надежден хостинг за сайтове с защита от DDoS, VPS VDS сървъри | ProHoster