Open Data Hub նախագիծը – Red Hat OpenShift հիման վրա բաց աղբյուրի մեքենայական ուսուցման հարթակ:

Երի մագլցումը արդեն այստեղ է. արհեստական բանականության և մեքենայական ուսուցման տեխնոլոգիաները արդեն հաջողությամբ կիրառվում են ձեր սիրելի խանութներում, տրանսպորտային ընկերություններում և նույնիսկ հնդկահավեր աճեցնող ֆերմաներում:

Open Data Hub նախագիծը – Red Hat OpenShift հիման վրա բաց աղբյուրի մեքենայական ուսուցման հարթակ:

Եվ եթե ինչ-որ բան գոյություն ունի, ապա դրա մասին ինտերնეტում արդեն կա... հանրային նախագիծ: Տեսեք, թե cómo Open Data Hub-ը օգնում է մեծացնել նոր տեխնոլոգիաները և խուսափել դրանց ներդրման դժվարություններից:

Երբևէ արհեստական բանականության (AI) և մեքենայական ուսուցման (ML) բոլոր առավելությունների հետ organizations-ներն հաճախ հանդիպում են այս տեխնոլոգիաների մեծացման հետ կապված դժվարությունների: Մուտքի հիմնական խնդիրները սովորաբար հետևյալներն են:

  • Տվյալների փոխանակում և համագործակցություն – անհարկի ջանքեր ներդնելու առանց տեղեկատվություն փոխանակել և արագ իտերացիաներով համագործակցել գրեթե անհնար է:
  • Տվյալներին մուտք – յուրաքանչյուր առաջադրանքի համար այն պետք է նորից և ձեռքով կառուցել, ինչը շատ ժամանակ է խլում:
  • Պահանջով մուտք – չկա հնարավորություն ստանալ պահանջով մուտք գործել մեքենայական ուսուցման գործիքներ և հարթակ, ինչպես նաև հաշվարկային ենթակառուցվածք:
  • Դիտարկում – մոդելները մնում են պրոտոտիպի փուլում և չեն հասցնում նախօրոք գործել:
  • AI-ի արդյունքների հետևում և բացատրություն – AI/ML արդյունքների վերարտադրելիությունը, հետևելը և բացատրությունը դժվար են:

Այս խնդիրների լուծումը գցում է ոչ միայն արագությանը, այլև արժեքավոր տվյալների մշակման և վերլուծության մասնագետների արդյունավետությանը և արտադրողականությանը: Սա նրանց դիմադրություն է բերում, աշխատանքային ապատիայի, և վերջում բիզնեսի ակնկալիքները AI/ML-ի վերաբերյալ մնում են միայն մի կողմ:

Այս խնդիրների լուծման պատասխանատվությունը թողնում է IT մասնագետների, ովքեր պետք է տրամադրեն տվյալների վերլուծաբաններին՝ ճիշտ, ինչ-որ նմանեալի խմբաքանակ: Եթե ավելի մանրամասն, ապա անհրաժեշտ է այնպիսի հարթակ, որը ազատ ընտրություն է տալիս և ունի հարմար, հեշտ մուտք: Այն արագ, հեշտ է վերափոխվում, պահանջով դասավորելի և ընդերքային է: Այսպիսի հարթակի կառուցումը բաց աղբյուրի տեխնոլոգիաների հիման վրա օգնում է չընկնել վենդորի կախման մեջ և պահպանել երկարաժամկետ ռազմավարական առավելություն ծախսերի վերահսկման առումով:

Անցյալ տարիներին նման բան տեղի ունեցավ ծրագրային ապահովման զարգացման ոլորտում և բերեց միկրոսերվիսների, հիբրիդի ամպային միջավայրերի, IT ավտոմատացման և agile գործընթացների ստեղծմանը: Երկրիտ երկինքը, IT մասնագետներ սկսեցին օգտագործել կոնտեյները, Kubernetes-ը և բաց հիբրիդային ամպերը:

Այժմ այս փորձը կիրառվում է AI-ի մարտահրավերներին պատասխանելու համար: Ուստի IT մասնագետներ ստեղծում են հարթակներ, որոնք հիմնված են կոնտեյների վրա, թույլ են տալիս ստեղծել AI/ML ծառայություններ agile գործընթացների շրջանակներում, արագացնում են նորարարությունները և կառուցվում են հիբրիդային ամպումների վրա:

Open Data Hub նախագիծը – Red Hat OpenShift հիման վրա բաց աղբյուրի մեքենայական ուսուցման հարթակ:

Այս պլատֆորմի կառուցումը մենք կսկսենք Red Hat OpenShift-ով, մեր Kubernetes կոնտեյներային պլատֆորմայով, որը նախատեսված է հիբրիդային.Cloud չեզոքացումների համար և ունի արագ զարգացող ծրագրային և հարմարանքային ML լուծումների էկոհամակարգ (NVIDIA, H2O.ai, Starburst, PerceptiLabs և այլն): Red Hat-ի որոշ հաճախորդներ, ինչպես BMW Group-ը, ExxonMobil-ը և մյուսները, արդեն տարածել են կոնտեյներային ML գործիքների շղթաներն ու DevOps գործընթացները այս պլատֆորմի և դրա էկոհամակարգերի հիման վրա, որպեսզի իրենց ML ճարտարապետությունները գործարկեն արդյունաբերական չափանիշներով և արագացնեն տվյալների վերլուծողների աշխատանքը.

Մեկ այլ պատճառ, որ մենք սկսել ենք Open Data Hub նախագիծը, ցույց տալ մի օրինակ մի քանի ազատ ծրագրերի (СПО) նախագծերի վրա հիմնված ճարտարապետության և ներկայացնել, թե ինչպես իրականացնել ML լուծման ամբողջ կյանքի ցիկլը OpenShift պլատֆորմայի վրա.

Open Data Hub նախագիծը

Սա բաց կոդով նախագիծ է, որն իրականացվում է համապատասխան զարգացման համայնքի շրջանակներում և իրականացնում է օպերացիաների ամբողջական ցիկլը՝ սկսած սկզբնական տվյալների բեռնելու և փոխակերպելուց մինչև մոդելի ձևավորումը, ուսուցումը և պահպանումը՝ AI/ML խնդիրների լուծման համար, օգտագործելով կոնտեյներներ և Kubernetes OpenShift պլատֆորմայի վրա: Այս նախագծին կարելի է վերաբերվել որպես ստանդարտ կատարման, օրինակ այն, ինչպես կառուցել բաց «AI/ML ծառայություն» հաճախորդի լուծում OpenShift-ի և համապատասխան բաց կոդային գործիքների հիման վրա, ինչպիսիք են Tensorflow-ը, JupyterHub-ը, Spark-ը և մյուսները: Կարևոր է նշել, որ Red Hat-ը ինքն օգտագործում է այս նախագիծը իր AI/ML ծառայությունները տրամադրելու համար: Բացի այդ, OpenShift-ը միանում է գլխավոր ծրագրային և հարմարանքային ML լուծումների հսկայից, ինչպիսիք են NVIDIA, Seldon, Starburst և այլ վաճառողների, ինչը հեշտացնում է սեփական մեքենայական ուսուցման համակարգեր կառուցելու և գործարկելու գործընթացը.

Open Data Hub նախագիծը – Red Hat OpenShift հիման վրա բաց աղբյուրի մեքենայական ուսուցման հարթակ:

Open Data Hub նախագիծը նախատեսված է հետևյալ օգտագործողների կատեգորիաների և օգտագործման սցենարների համար:

  • Տվյալների վերլուծաբան, ով պահանջում է ML նախագծերի իրականացման լուծում, կազմակերպված ամպի տեսքով ինքնաս服务 функциями:
  • Տվյալների վերլուծաբան, ով ուզում է առավելագույն ընտրություն բոլոր վերջին ազատ AI/ML գործիքների և պլատֆորմաների շարքում.
  • Տվյալների վերլուծաբան, ով ուզում է մոդելները ուսուցելու համար հասանելիություն տվյալների աղբյուրներին.
  • Տվյալների վերլուծաբեր, ով ուզում է մուտք գործել հաշվարկային ռեսուրսների (CPU, GPU, հիշողություն):
  • Տվյալների վերլուծաբան, ով պահանջում է համագործակցելու և աշխատանքի արդյունքները գործընկերների հետ փոխանակելու հնարավորություն, վերազինվելու օրինագծերի միջոցով:
  • Տվյալների վերլուծաբան, ով ցանկանում է համագործակցել ծրագրավորողների (ու devops թիմերի) հետ, որպեսզի նրա ML մոդելները և աշխատանքի արդյունքները անցնեն արտադրություն:
  • Տվյալների ինժեներ, ով պետք է ապահովի տվյալների վերլուծողների մուտք դեպի տարբեր տվյալների աղբյուրներ՝ անվտանգային նորմերի և պահանջների соблюдвելով.
  • Ադմինիստրատոր կամ IT համակարգերի օպերատոր, որը ցանկանում է առանց ավելորդ ջանքերի վերահսկել կոմպոնენტների և բաց կոդային տեխնոլոգիաների կյանքային ցիկլը (տեղադրում, կարգաբերում, թարմացում): Նաեւ անհրաժեշտ են համապատասխան կառավարման և քվոտավորման գործիքներ.

Open Data Hub նախագիծը համախմբում է բաց կոդային մի շարք գործիքներ AI/ML օպերացիաների ամբողջական ցիկլի իրականացման համար. առավելագույն աշխատանքային գործիքը տվյալների վերլուծաբանների համար այստեղ օգտագործվում է Jupyter Notebook: Այս գործիքակազմը այսօր լայն տարածում է գտել տվյալների մշակումով և վերլուծությամբ զբաղվող մասնագետների շրջանում, և Open Data Hub-ը թույլ է տալիս նրանց հեշտությամբ ստեղծել և կառավարել Jupyter Notebook աշխատանքային տարածքները `օգտագործելով ներմուծված JupyterHub-ը: Բացի Jupyter notebooks-ի ստեղծումից և ներմուծման գործընթացներից, Open Data Hub նախագիծը նաեւ պարունակում է արդեն իսկ պատրաստված notebooks-ների շարք, որոնք ներկայացված են AI Library-ի տեսքով.

Այս գրադարանը ներկայացնում է բաց աղբյուրի մեքենայական ուսուցման կոմպոնենտների և նախադրված սցենարների հավաքածու, որոնք կարող են պարզեցնել արագ օբյեկտների նախագծումը: JupyterHub-ը ինտեգրված է RBAC մոդելով OpenShift-ում, ինչը թույլ է տալիս օգտագործել արդեն գոյություն ունեցող OpenShift հաշիվները և իրականացնելու միանման մուտք համակարգ: Ի հավելումն, JupyterHub-ը առաջարկում է հարմարյալ օգտվողի միջերես `spawner անունով, որի միջոցով օգտվողը կարող է հեշտությամբ կարգավորել հաշվարկային ռեսուրսների ծավալը (խողովակային միջուկներ, հիշողություն, GPU) ընտրած Jupyter Notebook-ի համար.

Երբ տվյալների վերլուծաբանը ստեղծի և կարգավորի Notebook-ը, նրա մասին բոլոր մյուս հոգսերը վերցնում է Kubernetes ծրագրավորիչը, որը մաս է կազմում OpenShift-ին: Օգտագործողներին մնում է միայն իրականացնել իրենց փորձառությունները, պահպանել և կիսվել իրենց աշխատանքի արդյունքներով: Բացի այդ, զարգացած օգտվողները կարող են անմիջապես վերընթաց բանավարի OpenShift CLI-ի դիմել Jupyter notebooks-ից, որպեսզի ներգրավեն Kubernetes-յան նախադրյալներ, ինչպիսիք են Job-ը կամ OpenShift-ի ֆունկցիոնալությունը, ինչպես օրինակ Tekton կամ Knative: Որպեսզի սա հնարավոր լինի, կարելի է օգտագործել հարմարավետ OpenShift Graphical User Interface-ը, որը կոչվում է "OpenShift վեբ կոնսոլ".

Open Data Hub նախագիծը – Red Hat OpenShift հիման վրա բաց աղբյուրի մեքենայական ուսուցման հարթակ:

Open Data Hub նախագիծը – Red Hat OpenShift հիման վրա բաց աղբյուրի մեքենայական ուսուցման հարթակ:

Հաջորդ փուլին անցնելով, Open Data Hub-ը թույլ է տալիս կառավարել տվյալների խողովակները (data pipelines): Для этой цели используется объект Ceph, который предоставляется в виде S3-совместимого объектного хранилища данных. Apache Spark обеспечивает стриминг данных из внешних источников или встроенного хранилища Ceph S3, а также позволяет выполнять предварительные преобразования данных. Apache Kafka обеспечивает расширенное управление конвейерами данных (где можно осуществлять многократную загрузку, а также операции преобразования, анализа и сохранения данных).

Պարբերաբար, տվյալների վերլուծողը ստանում է տվյալների մուտք և կառուցում մոդել: Այժմ նա ցանկանում է կիսվել ձեռք բերված արդյունքներով իրեն գործընկերների կամ հավելվածների կազմողներին, և միաժամանակ տրամադրել նրանց մոդելը ծառայության սկզբունքների հիման վրա: Հենց դրա համար անհրաժեշտ է ելքային սերվեր, և Open Data Hub-ը ունի նման սերվեր, որը կոչվում է Seldon և թույլ է տալիս հրապարակել մոդելը RESTful-ծ služed.

Մի պահի, Seldon սերվերում այդպիսի մոդելներ սկսում են կուտակվել, և առաջանում է անհրաժեշտություն հետևել, թե ինչպես են դրանք օգտագործվում: Դրա համար Open Data Hub-ը առաջարկում է համապատասխան մետրիկաների հավաքածու և հաշվետվությունների շարժիչ, որը հիմնված է լայնորեն տարածված բաց կոդով մոնիտորինգի գործիքների (Prometheus և Grafana): Այդպիսով, մենք ստանում ենք կապակցություն AI մոդելների օգտագործման մոնիտորինգի համար, մասնավորապես արտադրական միջավայրում.

Open Data Hub նախագիծը – Red Hat OpenShift հիման վրա բաց աղբյուրի մեքենայական ուսուցման հարթակ:

Այսպիսով, Open Data Hub-ը ապահովում է Cloud-like մոտեցում ամբողջ AI/ML գործողությունների ցիկլի ընթացքում՝ սկսած տվյալների մուտքից և պատրաստումից մինչև մոդելի ուսուցում և արդյունաբերական շահագործում.

Բոլորն իրար միավորում ենք

Այժմ հարց է դրվում, թե ինչպես կազմակերպել սա OpenShift-ի ադմինիստրատորի համար: Եվ այստեղ գործի մեջ է մտնում հատուկ Kubernetes օպերատորը Open Data Hub նախագծերի համար.

Open Data Hub նախագիծը – Red Hat OpenShift հիման վրա բաց աղբյուրի մեքենայական ուսուցման հարթակ:

Սա օպերատորը կառավարում է Open Data Hub նախագծի տեղադրմանը, կարգավորելուն և կյանքի ցիկլին, ներառյալ վերոյակետված գործիքների (JupyterHub, Ceph, Spark, Kafka, Seldon, Prometheus և Grafana) տեղադրմանը: Open Data Hub նախագծը կարելի է գտնել OpenShift-ի վեբ կոնսոլում՝՝ community-օպերատորների բաժնում: Այդպիսով, OpenShift-ի ադմինիստրատորը կարող է նշել, որ համապատասխան OpenShift նախագծերը պատկանում են «Open Data Hub նախագիծ» կատեգորիային: Ավելին, դա արվում է մեկ անգամ: Հետո տվյալների վերլուծողը OpenShift-ի վեբ կոնսոլի միջոցով մտնում է իր նախագծային տարածք և տեսնում է, որ իր նախագծերի համար տեղադրված է և հասանելի է համապատասխան Kubernetes օպերատորը: Այնուհետ նա մեկ կտտացմամբ ստեղծում է Open Data Hub նախագծի օրինակ և անմիջապես ստանում մուտք վերոնշյալ գործիքներին: Եվ այս ամենը կարելի է կարգավորել բարձր հասանելիության և բաշխման դիմադրության ռեժիմով.

Open Data Hub նախագիծը – Red Hat OpenShift հիման վրա բաց աղբյուրի մեքենայական ուսուցման հարթակ:

Եթե ցանկանում եք ինքնուրույն փորձել Open Data Hub նախագիծը, սկսեք նրանից տեղադրության հայտարարություններից և վարքային ուսուցումից. Open Data Hub-ի տեխնիկական մանրամասները կարող եք գտնել այստեղ, նախագծի զարգացման ծրագրերը՝ այստեղ. Ապագայում նախատեսվում է իրականացնել լրացուցիչ ինտեգրումներ Kubeflow-ի, լուծել մի շարք հարցեր տվյալների կարգավորման և անվտանգության՝ ինչպես նաև կազմակերպել ինտեգրում Drools և Optaplanner հիմնված համակարգերի հետ: Ձեր կարծիքը հայտնելը և նախագծի մասնակիցը դառնալու համար Open Data Hub միանգամից կարող եք այցելել էջին համայնքի.

Համաձայնեք, որ լուրջ սկեյլինգի խնդիրները խանգարում են կազմակերպություններին լիարժեք օգտագործել արհեստական բանականության և մեքենայական ուսուցման ներուժը: Red Hat OpenShift-ը վաղուց և հաջողությամբ կիրառվում է նմանատիպ խնդիրների լուծման համար ծրագրային ապահովման ոլորտում: Open Data Hub նախագիծը, որը իրականացվում է բաց աղբյուրի զարգացման համայնքի շրջանակներում, առաջարկում է նմուշarchitectura AI/ML օպերացիաների ամբողջական ցիկլի կազմակերպման համար OpenShift հիբրիդային ամպի հիման վրա: Մեր մոտ կա հստակ ու մտածված զարգացման ծրագրի այդ նախագծի շուրջ, և մենք անկեղծ պատրաստվում ենք ստեղծել դրա շուրջ ակտիվ և արդյունավետ բաց AI լուծումներ մշակող համայնք OpenShift հարթակում.

Ընտանիք: habr.com

Գնել հուսալի հյուրընկալում DDoS պաշտպանությամբ, VPS VDS սերվերներով 🔥 Գնել հուսալի հյուրընկալում DDoS պաշտպանությամբ, VPS VDS սերվերներով | ProHoster