Open Data Hub projekt – avatud masinõppe platvorm Red Hat OpenShifti baasil

Tulevik on käes, tehisintellekti ja masinõppe tehnoloogiaid kasutatakse juba edukalt teie lemmikpoodides, transpordifirmades ja isegi kalkunifarmides.

Open Data Hub projekt – avatud masinõppe platvorm Red Hat OpenShifti baasil

Ja kui midagi eksisteerib, siis on sellest internetis juba... avatud projekt! Vaata, kuidas Open Data Hub aitab uusi tehnoloogiaid skaleerida ja keerukusi nende rakendamisel vältida.

Hoolimata tehisintellekti (artificial Intelligence, AI) ja masinõppe (machine learning, ML) kõigist eelistest seisavad organisatsioonid sageli silmitsi nende tehnoloogiate skaleerimisega seotud raskustega. Peamised probleemid on tavaliselt järgmised:

  • Teabe vahetamine ja koostöö – teavet vahetada ja koostööd teha kiirete iteratsioonide režiimis on praktiliselt võimatu.
  • Andmete kättesaadavus – iga ülesande jaoks tuleb see uuesti ja käsitsi üles ehitada, mis võtab palju aega.
  • Nõudmisest ligipääs – ei ole võimalik saada nõudmise korral juurdepääsu masinõppe tööriistadele ja platvormile, samuti arvutusinfrastruktuurile.
  • Tootmine – mudelid jäävad prototüübi staadiumisse ja ei jõua tooterakendusse.
  • AI tulemuste jälgimine ja seletamine – AI/ML tulemuste korduvus, jälgimine ja seletamine on keerulised.

Need lahendamata probleemid mõjutavad negatiivselt andmete töötlejate ja analüütikute väärtuslike spetsialistide töö kiirus, efektiivsus ja tootlikkus. See toob kaasa nende frustratsiooni ja tööalase pettumuse, mistõttu äri ootused AI/ML-i osas jäävad täitmata.

Nende probleemide lahendamise vastutus lasub IT-spetsialistidel, kes peavad andmeanalüütikutele pakkuma – õigesti öeldes, midagi, mis meenutab pilveteenust. Täiendavalt on vajalik selline platvorm, mis annab valikuvabaduse ning millele on lihtne ja mugav ligipääs. Samuti peaks see olema kiire, hõlpsasti kohandatav, nõudlikult skaleeritav ja tõrgeteta. Sellise platvormi loomine avatud lähtekoodiga tehnoloogiate põhjal aitab vältida sõltuvust tarnijast ja säilitada pikaajalist strateegilist eeliseid kulude kontrollimise osas.

Mõni aasta tagasi juhtus rakenduste arenduses midagi sarnast, mis viis mikroteenuste, hübriidsete pilvekeskkondade, IT-automaatika ja Agile-protsesside tekkeni. Selle kõigega sammu pidamiseks hakkasid IT-spetsialistid kasutama konteinerite, Kubernetes'i ja avatud hübriidpilvede lahendusi.

Nüüd rakendatakse seda kogemust AI-väljakutsetele vastamisel. Seetõttu loovad IT-spetsialistid platvorme, mis põhinevad konteineritel, võimaldavad luua AI/ML-teenuseid Agile-protsesside raames, kiirendavad innovatsiooni ja on suunatud hübriidpilvele.

Open Data Hub projekt – avatud masinõppe platvorm Red Hat OpenShifti baasil

Selle platvormi ehitamise alustame Red Hat OpenShiftist, meie konteinerite Kubernetes'i platvormist hübriidpilve jaoks, millel on kiiresti kasvav ML-lahenduste tarkvara ja riistvara ökosüsteem (NVIDIA, H2O.ai, Starburst, PerceptiLabs jne). Red Hati mõned kliendid, nagu BMW Group, ExxonMobil ja teised, on juba käivitanud konteineriseeritud ML-tööriistade ahelad ja DevOps-protsessid selle platvormi ja selle ökosüsteemi baasil, et viia oma ML-arkitektuurid tootmisrežiimi ja kiirendada andmeanalüütikute tööd.

Veel põhjuseid, miks käivitasime Open Data Hub'i projekti, on näidata näidisarhitektuuri mitmete avatud lähtekoodiga projektide põhjal ning näidata, kuidas rakendada kogu ML-lahenduse elutsüklit OpenShift platvormil.

Open Data Hub'i projekt

See on avatud lähtekoodiga projekt, mis areneb vastava arenduskogukonna raames ja rakendab täieliku toimingute tsükli – algandmete üleslaadimisest ja töötlemisest mudeli loomise, koolitamise ja toe andmiseni – AI/ML ülesannete lahendamisel konteinerite ja Kubernetes'e abil OpenShift platvormil. Seda projekti võib pidada referentsrakenduseks, näidates, kuidas luua avatud lahendust "AI/ML teenusena" OpenShift'i ja vastava avatud lähtekoodiga tööriistade, nagu Tensorflow, JupyterHub, Spark ja teiste, põhjal. Oluline on märkida, et Red Hat kasutab seda projekti ka oma AI/ML teenuste pakkumiseks. Lisaks integreerub OpenShift NVIDIA, Seldon, Starbust ja teiste tarnijate võtme tark- ja riistvaraliste ML-lahendustega, mis lihtsustab enda masinõppesüsteemide loomist ja käivitamist.

Open Data Hub projekt – avatud masinõppe platvorm Red Hat OpenShifti baasil

Open Data Hub projekt on suunatud järgmistele kasutajate kategooriatele ja kasutusstsenaariumitele:

  • Andmeanalüütik, kes vajab pilvepõhiste ise teenindamise funktsioonidega lahendust ML-projektide elluviimiseks.
  • Andmeanalüütik, kellele on vaja maksimaalset valikut uusimatest avatud lähtekoodiga AI/ML tööriistadest ja platvormidest.
  • Andmeanalüütik, kellele on vajalik juurdepääs andmeallikatele mudelite koolitamise ajal.
  • Andmeanalüütik, kellele on vajalik juurdepääs arvutusressurssidele (CPU, GPU, mälu).
  • Andmeanalüütik, kellele on vajalik võimalus koostada ja jagada oma töö tulemusi kolleegidega, saada tagasisidet ja siseneda parendusi kiire iteratsiooni meetodil.
  • Andmeanalüütik, kes soovib suhelda arendajate (ja devops meeskondade) kaudu, et tema ML-mudelid ja töö tulemused jõuaksid tootmisse.
  • Andmeinsener, kellele on vajalik anda andmeanalüütikule juurdepääs mitmekesistele andmeallikatele, järgides ohutuse norme ja nõudeid.
  • IT-süsteemide administraator või operaator, kellele on vajalik võimalus hõlpsasti hallata avatud koodiga komponentide ja tehnoloogiate elutsüklit (paigaldamine, seadistamine, uuendamine). Samuti on vajalikud vastavad haldus- ja kvoteerimistööriistad.

Open Data Hub projekt ühendab endas mitmeid avatud koodiga tööriistu AI/ML operatsioonide täieliku tsükli teostamiseks. Peamise tööriistana andmeanalüütiku jaoks kasutatakse siin Jupyter Notebooki. See tööriist on tänapäeval laialdaselt populaarne andmete töötlemise ja analüüsi spetsialistide seas, ning Open Data Hub võimaldab neil hõlpsasti luua ja hallata Jupyter Notebooki töökeskkondi, kasutades sisseehitatud JupyterHub'i. Lisaks Jupyter notebook'ide loomisele ja importimisele sisaldab Open Data Hub ka mitmeid juba valmis Jupyter notebook'e AI Library kujul.

See raamatukogu sisaldab open-source masinõppe komponente ja lahendusi tüüpiliste stsenaariumide jaoks, mis lihtsustavad kiiret prototüüpimist. JupyterHub on integreeritud OpenShift'i RBAC-juurdepääsu mudeliga, mis võimaldab kasutada olemasolevaid OpenShift'i kontosid ja rakendada ühtset sisselogimist. Lisaks pakub JupyterHub mugavat kasutajaliidest nimega spawner, mille abil saab kasutaja hõlpsasti seadistada valitud Jupyter Notebooki jaoks arvutusressursse (protsessorituumad, mälu, GPU).

Pärast seda, kui andmeanalüütik on loonud ja seadistanud notebook'i, võtab kõik ülejäänud hoolduse enda peale Kubernetes'i ajakava, mis on osa OpenShift'ist. Kasutajatele jääb vaid katsetamine, tulemuste salvestamine ja jagamine. Lisaks saavad edasijõudnud kasutajad otse Jupyter notebook'idest ligipääsu OpenShift'i CLI-keskkonnale, et kasutada Kubernetes'e primitiive, nagu Job, või OpenShift'i funktsioone, näiteks Tekton või Knative. Selle jaoks saab kasutada ka mugavat OpenShift'i GUI-d, mida nimetatakse "OpenShift'i veebikonsooliks".

Open Data Hub projekt – avatud masinõppe platvorm Red Hat OpenShifti baasil

Open Data Hub projekt – avatud masinõppe platvorm Red Hat OpenShifti baasil

Liikudes järgmisele tasemele, võimaldab Open Data Hub hallata andmekanaleid (data pipelines). Selleks kasutatakse Ceph-objekti, mis on pakutud S3-ühilduva objektipõhise andmete salvestusena. Apache Spark tagab andmete voogedastuse välistest allikatest või Ceph S3 sisseehitatud salvestusest ning võimaldab ka andmete eelnevaid muundamisi. Apache Kafka pakub laiaulatuslikku andmekanalite haldust (kus on võimalik teha korduvlaadimist ning andmete muundamise, analüüsi ja salvestamise toiminguid).

Nii et andmeanalüütik on saanud andmetele ligi ja loonud mudeli. Nüüd on tal soov jagada saadud tulemusi kolleegide või rakenduste arendajatega ning anda neile oma mudel teenusena. Selleks on vajalik väljundiserver, ja Open Data Hub'il on selline server, mida nimetatakse Seldoniks ja mis võimaldab mudelit RESTful-teenusena avaldada.

Mingil uuel hetkel on serveris Seldon mitmeid mudeleid ja tekib vajadus jälgida, kuidas neid kasutatakse. Sel eesmärgil pakub Open Data Hub kogumi vastavaid mõõdikuid ja aruannete mootorit, mis tugineb laialdaselt kasutatavatele avatud lähtekoodiga jälgimisvahenditele Prometheus ja Grafana. Tulemuseks on tagasiside AI mudelite kasutamise jälgimiseks, eelkõige tootmis keskkonnas.

Open Data Hub projekt – avatud masinõppe platvorm Red Hat OpenShifti baasil

Selle tulemusena pakub Open Data Hub pilve sarnast lähenemist kogu AI/ML operatsioonide tsükli vältel, alustades andmete juurdepääsust ja ettevalmistamisest ning lõpetades mudeli koolituse ja tööstusliku kasutamisega.

Kogume kõik kokku

Nüüd kerkib küsimus, kuidas kõike seda OpenShift'i administraator korraldab. Ja siinkohal astub mängu spetsiaalne Kubernetes'i operaator Open Data Hub'i projektide jaoks.

Open Data Hub projekt – avatud masinõppe platvorm Red Hat OpenShifti baasil

See operaator haldab Open Data Hubi projekti installatsiooni, seadistuse ja elutsüklit, sealhulgas selliste eelpoolmainitud tööriistade nagu JupyterHub, Ceph, Spark, Kafka, Seldon, Prometheus ja Grafana kasutuselevõttu. Open Data Hubi projekti leidmine on võimalik OpenShifti veebikonsoolist jaotises community-operatorid. Seega saab OpenShifti administraator määrata, et vastavad OpenShifti projektid kuuluvad kategooriasse „Open Data Hubi projekt”. Seda tehakse üks kord. Pärast seda pääseb andmeanalüütik OpenShifti veebikonsooli kaudu oma projektiruumidesse ja näeb, et tema projektidele on installitud ja saadaval vastav Kubernetes-opeator. Seejärel loob ta ühe hiireklõpsuga Open Data Hubi projekti ja saab kohe juurde juurdepääsu eelkirjeldatud tööriistadele. Ja kõik see saab olla konfigureeritud kõrge kättesaadavuse ja talitlushäiredest taastumise režiimis.

Open Data Hub projekt – avatud masinõppe platvorm Red Hat OpenShifti baasil

Kui soovite ise proovida Open Data Hubi projekti, alustage installatsiooni juhenditest ja sissejuhatavast õppematerjalist. Open Data Hubi arhitektuuri tehnilised üksikasjad on saadaval siit, projekti arendusplaanid – siit. Tulevikus plaanime ellu viia täiendava integreerimise Kubeflowiga, lahendada mitmeid andmete ja turvalisuse regulatsiooniga seotud küsimusi ning korraldada integreerimist Droolsi ja Optaplanneri reeglitepõhiste süsteemidega. Avaldage oma arvamus ja osalege projektis Open Data Hub lehelt kogukond.

Kokkuvõtteks: tõsised skalaarimisprobleemid takistavad organisatsioonidel täielikult kasutada tehisintellekti ja masinõppe potentsiaali. Red Hat OpenShift on juba pikka aega edukalt lahendanud sarnaseid probleeme tarkvarasektoris. Projekti Open Data Hub, mis on ellu viidud avatud lähtekoodiga arenduskogukonna raames, pakub põhistruktuuri AI/ML operatsioonide täielikuks tsükliks OpenShifti hübriidpilves. Meil on selge ja hästi läbimõeldud plaan selle projekti arendamiseks ning oleme tõsiselt pühendunud aktiivse ja tulemusliku avatud AI-lahenduste arenduskogukonna loomisele OpenShifti platvormil.

Allikas: habr.com

Osta usaldusväärne veebihosting DDoS kaitsega, VPS VDS serverid 🔥 Osta usaldusväärne veebihosting DDoS kaitsega, VPS VDS serverid | ProHoster