Open Data Hub projekt on avatud platvorm masinõppe jaoks, mis põhineb Red Hat OpenShiftil

Tulevik on käes, tehisintellekti ja masinõppe tehnoloogiaid kasutavad juba edukalt teie lemmikpoed, transpordifirmad ja isegi kalkunifarmid.

Open Data Hub projekt on avatud platvorm masinõppe jaoks, mis põhineb Red Hat OpenShiftil

Ja kui midagi eksisteerib, siis on sellest juba ka internetis... avatud projekt! Vaadake, kuidas Open Data Hub aitab uusi tehnoloogiaid skaleerida ja vältida raskusi nende rakendamisel.

Kuigi tehisintellekti (AI) ja masinõpet (ML) iseloomustavad mitmed eelised, seisavad organisatsioonid sageli silmitsi nende tehnoloogiate skaleerimisse seotud raskustega. Peamised probleemid on reeglina järgmised:

  • Infovahetus ja koostöö – infovahetus ilma üleliigsete pingutusteta ja kiirete iteratsioonide jooksul on praktiliselt võimatu.
  • Andmete kättesaadavus – igaks ülesandeks tuleb see uuesti ja käsitsi üles ehitada, mis võtab palju aega.
  • Nõudmisel ligipääs – ei ole võimalust saada nõudmisel ligipääs masinõppe tööriistadele ja platvormile, samuti arvutusinfrastruktuurile.
  • Tootmisse viimine – mudelid jäävad prototüübi staadiumisse ega jõua tootmisestandarditeni.
  • AI tulemuste jälgimine ja selgitamine – AI/ML tulemuste reproduktsioon, jälgimine ja selgitamine on keerulised.

Kui neid probleeme lahendada ei õnnestu, mõjutavad need negatiivselt andmete töötlemise ja analüüsi spetsialistide töö kiirus, efektiivsus ja tootlikkus. See toob kaasa nende frustratsiooni, tööalase pettumuse ning äri ootuste purunemise seoses AI/ML-iga.

Kohustus nende probleemide lahendamise eest lasub IT-spetsialistidel, kes peavad tagama andmeanalüütikutele – õige, midagi taolist nagu pilv. Täiendavalt on vajalik selline platvorm, mis tagab valikuvabaduse ja millele on lihtne ja mugav ligi pääseda. Samuti peab see olema kiire, kergesti kohandatav, nõudmisel skaleeritav ja tõrgeteta. Sellise platvormi ülesehitamine avatud lähtekoodiga tehnoloogiate põhjal aitab vältida sõltuvust tarnijast ja säilitada pikaajaline strateegiline eelis kulude kontrolli osas.

Mõni aasta tagasi toimusid rakenduste arenduses sarnased protsessid, mis viisid mikroteenuste, hübriidpilvkeskkondade, IT-automatiseerimise ja agile-protsesside tekkeni. Selle kõigega hakkasid IT-spetsialistid kasutama konteinerite, Kubernetes'i ja avatud hübriidpilvede lahendusi.

Nüüd rakendatakse seda kogemust AI-väljakutsete lahendamiseks. Seetõttu loovad IT-spetsialistid platvorme, mis põhinevad konteineritel, võimaldavad luua AI/ML-teenuseid agile-protsesside raames, kiirendavad innovatsiooni ja on suunatud hübriidpilvele.

Open Data Hub projekt on avatud platvorm masinõppe jaoks, mis põhineb Red Hat OpenShiftil

Selle platvormi loomist alustame Red Hat OpenShiftist, meie konteineripõhisest Kubernetes'i platvormist hübriidpilve jaoks, millel on kiiresti kasvav tarkvara ja riistvara ML-lahenduste ökosüsteem (NVIDIA, H2O.ai, Starburst, PerceptiLabs jne). Mõned Red Hati kliendid, nagu BMW Group, ExxonMobil ja teised, on juba juurutanud konteineriseeritud ML-tööriistade ahelaid ja DevOps-protsesse selle platvormi ja selle ökosüsteemi baasil, et viia oma ML-arhitektuurid tööstuslikele tasemetele ja kiirendada andmeanalüütikute tööd.

Teine põhjus, miks me käivitasime Open Data Hub'i projekti, on näidata mitme avatud lähtekoodiga projekti põhjal loodud arhitektuuri näidet ja tutvustada, kuidas teostada kogu ML-lahenduse elutsüklit OpenShifti platvormi raames.

Open Data Hub'i projekt

See on avatud lähtekoodiga projekt, mis areneb vastavas arendusühenduses ja rakendab täielikult operatsioonide tsükli - algandmete laadimisest ja töötlemisest mudeli loomise, koolituse ja hooldamiseni - AI/ML ülesannete lahendamiseks konteinerite ja Kubernetes'e kaudu OpenShifti platvormil. Seda projekti võib pidada viidatud teostuseks, näiteks avatud lahenduse loomiseks 'AI/ML teenusena' OpenShifti ja vastavate avatud lähtekoodiga tööriistade, nagu Tensorflow, JupyterHub, Spark ja teiste, põhjal. Oluline on märkida, et Red Hat kasutab seda projekti oma AI/ML teenuste tarnimiseks. Lisaks integreerub OpenShift võtmetarkvara ja riistvara ML-lahendustega NVIDIA, Seldon, Starburst ja teiste tootjate poolt, mis lihtsustab oma masinõppe süsteemide loomist ja käivitamist.

Open Data Hub projekt on avatud platvorm masinõppe jaoks, mis põhineb Red Hat OpenShiftil

Open Data Hub'i projekt on suunatud järgmistele kategooriatele kasutajatele ja kasutusstsenaariumitele:

  • Andmeanalüütik, kellele on vajalik pilvepõhine ML-projektide rakendamise lahendus, mis on korraldatud iseteeninduslikult.
  • Andmeanalüütik, kellele on vajalik maksimaalne valik kõige uuematest avatud lähtekoodiga AI/ML tööriistadest ja platvormidest.
  • Andmeanalüütik, kellele on vajalik ligipääs andmeallikatele mudelite treenimise ajal.
  • Andmeanalüütik, kellele on vajalik ligipääs arvutusressurssidele (CPU, GPU, mälu).
  • Andmeanalüütik, kellele on vajalik võimalus koostööks ja töö tulemuslikkuse jagamiseks kolleegidega, tagasiside saamiseks ja parenduste tegemiseks kiirete iteratsioonide meetodil.
  • Andmeanalüütik, kes soovib suhelda arendajate (ja devops meeskondade) ning tema ML mudelite ja töö tulemuste viimise osas tootmisse.
  • Andmeinsener, kellele on vajalik anda andmeanalüütikutele juurdepääs mitmekesistele andmeallikatele kooskõlas turvanõuete ja standarditega.
  • IT-süsteemide administraator/operatsioonide teostaja, kellele on vajalik võimalus vaevata hallata komponentide ja avatud lähtekoodiga tehnoloogiate elutsüklit (paigaldamine, seadistamine, uuendamine). Samuti on vajalikud vastavad haldus- ja kvootide tööriistad.

Open Data Hub projekt ühendab endas mitmeid avatud lähtekoodiga tööriistu AI/ML operatsioonide täieliku tsükli rakendamiseks. Andmeanalüütiku peamiseks tööriistaks on siin Jupyter Notebook. See tööriist on täna laialdaselt populaarne andmete töötlemise ja analüüsi spetsialistide seas ning Open Data Hub võimaldab neil hõlpsasti luua ja hallata Jupyter Notebooki tööalasid, kasutades sisse ehitatud JupyterHubi. Lisaks Jupyter notebookide loomisele ja importimisele sisaldab Open Data Hub projekt ka mitmeid juba valmis Jupyter notebook'e AI Library raamatukogus.

See teekond on open-source masinõppe komponentide ja lahenduste kogu, mis lihtsustab kiire prototüüpimise tüüpilisi stsenaariume. JupyterHub on integreeritud OpenShift'i RBAC-juurdepääsu mudeliga, mis võimaldab kasutada juba olemasolevaid OpenShift'i konto ja rakendada ühtset sisselogimist. Lisaks pakub JupyterHub mugavat kasutajaliidest nimega spawner, mille abil saab kasutaja hõlpsasti seadistada valitud Jupyter Notebook'i arvutusressursse (protsessori tuumad, mälu, GPU).

Pärast seda, kui andmeanalüütik on loonud ja seadistanud notebook'i, võtab kõik muud kohustused enda kanda Kubernetes'i ajakava, mis on osa OpenShift'ist. Kasutajatele jääb üle vaid eksperimenteerida, salvestada ja jagada oma töö tulemusi. Lisaks saavad edasijõudnud kasutajad otse pöörduda OpenShift'i CLI-keskkonna poole otse Jupyter notebook'idest, et kasutada Kubernetes'i primitiive, nagu Job, või OpenShift'i funktsioone, näiteks Tekton või Knative. Selleks saab kasutada ka mugavat OpenShift'i GUI-d, mida nimetatakse "OpenShift'i veebikonsooliks".

Open Data Hub projekt on avatud platvorm masinõppe jaoks, mis põhineb Red Hat OpenShiftil

Open Data Hub projekt on avatud platvorm masinõppe jaoks, mis põhineb Red Hat OpenShiftil

Liikudes järgmisele tasandile, annab Open Data Hub võimaluse hallata andmeprotsesse (data pipelines). Selleks kasutatakse Ceph-objekti, mis on saadaval S3-ühilduva objektide salvestusena. Apache Spark võimaldab andmete voogedastust välistest allikatest või sisse ehitatud Ceph S3 salvestusruumist, samuti andmete eelvormete tegemist. Apache Kafka pakub laiaulatuslikku andmeprotsesside haldamist (kus saab teostada korduvat laadimist, samuti andmete muutmis-, analüüsi- ja salvestamisoperatsioone).

Nii et andmeanalüütik on andmetele juurde pääsenud ja mudeli loonud. Nüüd on tal soov jagada saadud tulemusi kolleegide või rakenduste arendajatega, pakkudes neile oma mudelit teenusena. Selleks on vajalik väljundiserver, ja Open Data Hub'is on selline server, mis nimetatakse Seldon ja võimaldab mudelit avaldada RESTful-teenusena.

Mõnes etapis on Seldoni serveris mitmeid selliseid mudeleid ja tekib vajadus jälgida, kuidas neid kasutatakse. Selleks pakub Open Data Hub vastavate mõõdikute kogumit ja aruandlusmootorit, mis põhineb laialdaselt kasutatavatel avatud lähtekoodiga jälgimisriistadel Prometheus ja Grafana. Tulemuseks on tagasiside AI mudelite kasutamise jälgimiseks, eelkõige tootmis keskkonnas.

Open Data Hub projekt on avatud platvorm masinõppe jaoks, mis põhineb Red Hat OpenShiftil

Seega tagab Open Data Hub pilve sarnase lähenemise kogu AI/ML operatsioonide tsükli vältel, hakates andmete juurde pääsemisest ja nende ettevalmistamisest ning lõpetades mudeli koolituse ja tööstusliku käitamisega.

Kogume kõik ühte

Nüüd kerkib küsimus, kuidas kogu seda korraldada OpenShifti administraatorile. Siin tuleb mängu spetsiaalne Kubernetes operaator Open Data Hubi projektide jaoks.

Open Data Hub projekt on avatud platvorm masinõppe jaoks, mis põhineb Red Hat OpenShiftil

See operaator haldab Open Data Hub projekti installimise, seadistamise ja elutsükli, sealhulgas selliste ülalmainitud tööriistade nagu JupyterHub, Ceph, Spark, Kafka, Seldon, Prometheus ja Grafana juurutamist. Open Data Hub projekti võib leida OpenShifti veebikonsolist, kogukonna operaatorite sektsioonist. Seetõttu võivad OpenShifti administraatorid määrata, et vastavad OpenShifti projektid kuuluvad kategooriasse "Open Data Hub projekt". Seda tehakse vaid üks kord. Pärast seda siseneb andmeanalüütik OpenShifti veebikonsoli kaudu oma projektiruumi ja näeb, et tema projektide jaoks on vastav Kubernetes operaator installitud ja saadaval. Seejärel loob ta Open Data Hub projekti ühe hiireklikiga ja saab kohe juurdepääsu ülaltoodud tööriistadele. Ja kõike seda saab seadistada kõrge kättesaadavuse ja vigadetaluvuse režiimis.

Open Data Hub projekt on avatud platvorm masinõppe jaoks, mis põhineb Red Hat OpenShiftil

Kui soovite proovida Open Data Hubi projekti oma kätega, alusta installatsiooni juhistest ja sissejuhatavast õpetusest. Open Data Hubi arhitektuuri tehnilisi üksikasju saab leida siin, projekti arenguplaanid - siin. Tulevikus on plaanis ellu viia täiendav integreerimine Kubeflowliga, lahendada mitmeid andmete reguleerimise ja turvalisuse küsimusi ning korraldada integreerimine reeglite põhiste süsteemidega Drools ja Optaplanner. Oma arvamuse avaldamiseks ja projekti osaliseks saamiseks Open Data Hub võib leida lehelt kogukond.

Kokkuvõtteks: tõsised skaleeritavuse probleemid takistavad organisatsioonide täieliku tehisintellekti ja masinõppe potentsiaali ärakasutamist. Red Hat OpenShift on juba pikka aega edukalt rakendatud sarnaste probleemide lahendamiseks tarkvaratööstuses. Open Data Hubi projekt, mis on ellu viidud avatud lähtekoodiga arenduse kogukonnas, pakub referentsarhitektuuri AI/ML operatsioonide täieliku tsükli korraldamiseks Red Hat OpenShift hübriidpilve põhjal. Meil on selge ja läbimõeldud plaan selle projekti arendamiseks ning me oleme tõsiselt pühendunud aktiivse ja viljaka avatud AI-lahenduste arenduse kogukonna loomisele OpenShift platvormil.

Allikas: habr.com

Osta usaldusväärne hostimine veebilehtede jaoks DDoS-i kaitsega, VPS VDS serverid 🔥 Osta usaldusväärne hostimine veebilehtede jaoks DDoS-i kaitsega, VPS VDS serverid | ProHoster