Të ardhmen e teknologjisë e solli inteligjenca artificiale dhe mësimi i makinave, që tashmë po përdoren me sukses nga dyqanet tuaja të preferuara, kompanitë e transportit dhe madje edhe fermat që rrisin kalkun.

Dhe nëse diçka ekziston, atëherë në internet padyshim ekziston⊠një projekt i hapur! Shikoni se si Open Data Hub ndihmon në shkallëzimin e teknologjive të reja dhe shmangien e vështirësive gjatë aplikimit të tyre.
Megjithë të gjithë përfitimet e inteligjencës artificiale (artificial Intelligence, AI) dhe mësimit të makinave (machine learning, ML), organizatat shpesh hasin vështirësi në shkallëzimin e këtyre teknologjive. Problemet kryesore në këtë rast zakonisht janë si më poshtë:
- ShkĂ«mbimi i informacionit dhe bashkĂ«punimi â Ă«shtĂ« praktikisht e pamundur tĂ« shkĂ«mbehen informacionet pa vĂ«shtirĂ«si dhe tĂ« bashkĂ«punohet nĂ« mĂ«nyrĂ« tĂ« shpejtĂ«.
- QăąăŻă»ăč i tĂ« dhĂ«nave â pĂ«r çdo detyrĂ«, ai duhet tĂ« ndĂ«rtohet nga e para dhe manualisht, çka merr shumĂ« kohĂ«.
- QăąăŻă»ăč sipas kĂ«rkesĂ«s â nuk ka mundĂ«si tĂ« merret qasje on-demand nĂ« mjetet dhe platformĂ«n e mĂ«simit tĂ« makinave, si dhe nĂ« infrastrukturĂ«n llogaritĂ«se.
- Produksioni â modelet mbeten nĂ« fazĂ«n e prototipit dhe nuk arrijnĂ« nĂ« pĂ«rdorimin nĂ« prodhim.
- Ndjekja dhe shpjegimi i rezultateve tĂ« punĂ«s sĂ« AI â riprodhueshmĂ«ria, ndjekja dhe shpjegimi i rezultateve AI/ML janĂ« tĂ« vĂ«shtira.
Nëse këto probleme lihen pa zgjidhje, ato ndikojnë negativisht në shpejtësinë, efikasitetin dhe produktivitetin e ekspertëve të çmuar në përpunimin dhe analizimin e të dhënave. Kjo çon në frustrimin e tyre, zhgënjimin nga puna, dhe në fund të fundit, pritjet e biznesit në lidhje me AI/ML shkojnë dëm.
Përgjegjësia për zgjidhjen e këtyre problemeve bie mbi specialistët IT, të cilët duhet t'u ofrojnë analistëve të të dhënave - saktësisht, diçka si një nube. Nëse tregojmë më gjerësisht, nevojitet një platformë që ofron liri zgjedhjeje dhe ka qasje të lehtë dhe të thjeshtë. Ajo duhet të jetë e shpejtë, lehtësisht e ri-konfiguruar, e shkallëzueshme sipas kërkesës dhe e qëndrueshme ndaj dështimeve. Ndërtimi i një platforme të tillë mbi teknologji me kod të hapur ndihmon të mos bien në varësi të furnizuesve dhe të ruajnë një avantazh strategjik afatgjatë në kontrollin e kostove.
Para disa vjetësh, diçka e ngjashme ndodhi në zhvillimin e aplikacioneve dhe çoi në shfaqjen e mikroshërbimeve, mjediseve të hibridizuara në cloud, automatizimit IT dhe proceseve agile. Për të menaxhuar gjithë këtë, specialistët IT filluan të përdorin kontejnerë, Kubernetes dhe cloud të hapur hibrid.
Tani kjo përvojë aplikohet për të përballuar sfidat e AI. Prandaj, specialistët IT po krijojnë platforma që bazohet në kontejnerë, ndihmon në krijimin e shërbimeve AI/ML brenda proceseve agile, përshpejton inovacionet dhe ndërtohen me synim në cloud të hibridizuar.

Ndihmën për ndërtimin e një platforme të tillë do ta fillojmë me Red Hat OpenShift, platformën tonë konteinerë Kubernetes për hibridin cloud, e cila ka një ekosistem në rritje të shpejtë të zgjidhjeve të softuerëve dhe harduerëve ML (NVIDIA, H2O.ai, Starburst, PerceptiLabs, etj.). Disa nga klientët e Red Hat, si BMW Group, ExxonMobil dhe të tjerë, tashmë kanë implementuar zinxhirë konteinerë të mjeteve ML dhe proceseve DevOps mbi këtë platformë dhe ekosistemin e saj, për të çuar arkitekturën e tyre ML në një mënyrë industriale dhe për të përshpejtuar punën e analistëve të të dhënave.
Një arsye tjetër përse ne kemi lançuar projektin Open Data Hub është për të demonstruar një shembull arkitekturor bazuar në disa projekte të softuerëve të hapur dhe për të treguar si të realizohet i gjithë cikli i jetës së zgjidhjes ML mbi platformën OpenShift.
Projekti Open Data Hub
Ky Ă«shtĂ« njĂ« projekt me kod tĂ« hapur qĂ« zhvillohet brenda komunitetit pĂ«rkatĂ«s tĂ« zhvillimit dhe realizon njĂ« cikĂ«l tĂ« plotĂ« operacionet â nga ngarkimi dhe transformimi i tĂ« dhĂ«nave fillestare deri nĂ« formimin, stĂ«rvitjen dhe mbĂ«shtetje tĂ« modelit â nĂ« zgjidhjen e problemeve AI/ML duke pĂ«rdorur kontejnerĂ« dhe Kubernetes mbi platformĂ«n OpenShift. Ky projekt mund tĂ« konsiderohet si njĂ« implementim referencial, njĂ« shembull se si tĂ« ndĂ«rtohet njĂ« zgjidhje tĂ« hapur tĂ« klasĂ«s "AI/ML si shĂ«rbim" mbi bazĂ«n e OpenShift dhe mjeteve pĂ«rkatĂ«se me kod tĂ« hapur si Tensorflow, JupyterHub, Spark dhe tĂ« tjera. ĂshtĂ« e rĂ«ndĂ«sishme tĂ« theksohet se Red Hat vetĂ« pĂ«rdor kĂ«tĂ« projekt pĂ«r tĂ« ofruar shĂ«rbimet e saj AI/ML. PĂ«r mĂ« tepĂ«r, OpenShift integrohet me zgjidhjet kyçe tĂ« softuerĂ«ve dhe harduerĂ«ve ML nga NVIDIA, Seldon, Starburst dhe ndihma e tĂ« tjerĂ«ve, qĂ« lehtĂ«son ndĂ«rtimin dhe implementimin e sistemeve tĂ« veta pĂ«r mĂ«simin e makinave.

Projekti Open Data Hub është i orientuar drejt kategorive të mëposhtme të përdoruesve dhe skenarëve të përdorimit:
- Analisti i të dhënave që i nevojitet një zgjidhje për implementimin e projekteve ML, e organizuar si një shërbim në re me funksione vetë-shërbimi.
- Analisti i të dhënave që ka nevojë për zgjedhje maksimale nga e gjithë larmia e veglave dhe platformave më të reja AI/ML me kod të hapur.
- Analisti i të dhënave që i nevojitet qasje në burimet e të dhënave gjatë trajnimit të modeleve.
- Analisti i të dhënave që ka nevojë për qasje në burimet kompjuterike (CPU, GPU, memorie).
- Analisti i të dhënave që i nevojitet mundësia për të bashkëpunuar dhe ndarë rezultatet e punës me kolegët, për të marrë feedback dhe për të bërë përmirësime përmes iteracioneve të shpejta.
- Analisti i të dhënave që dëshiron të bashkëpunojë me zhvilluesit (dhe ekipet devops), në mënyrë që modelet e tij ML dhe rezultatet të kalojnë në prodhim.
- Inxhinieri i të dhënave që i nevojitet të sigurojë që analisti i të dhënave të ketë qasje në burime të larmishme të të dhënave duke respektuar normat dhe kërkesat e sigurisë.
- Administrator/operator i sistemeve IT që i nevojitet mundësia për të kontrolluar pa shqetësime ciklin e jetës (instalimi, konfigurimi, përditësimi) të komponentëve dhe teknologjive me kod të hapur. Gjithashtu janë të nevojshme mjete për menaxhim dhe kuotim.
Projekti Open Data Hub përmbledh një sërë veglash me kod të hapur për realizimin e ciklit të plotë të operacioneve AI/ML. Si mjetin kryesor të punës për analistin e të dhënave, këtu përdoret Jupyter Notebook. Ky instrument është shumë popullor ndër specialistët e përpunimit dhe analizës së të dhënave, dhe Open Data Hub u lejon atyre të krijojnë dhe menaxhojnë lehtësisht hapësirat e punës Jupyter Notebook, duke përdorur JupyterHub të integruar. Përveç krijimit dhe importit të notebooks Jupyter, projekti Open Data Hub përmban gjithashtu një sërë notebooks tashmë të gatshme në formën e Bibliotekës AI.
Ky kjo bibliotekë përfaqëson një koleksion komponentësh open-source për mësimin e makinës dhe zgjidhjeve për skenarë të zakonshëm, që e lehtësojnë prototipizimin e shpejtë. JupyterHub është integruar me modelin e qasjes RBAC të OpenShift, e cila lejon përdorimin e llogarive ekzistuese OpenShift dhe implementimin e një hyrjeje të vetme në sistem. Për më tepër, JupyterHub ofron një ndërfaqe përdoruesi të thjeshtë të quajtur spawner, me të cilën përdoruesi mund të përshtatë lehtësisht sasinë e burimeve të llogaritjes (në bërthama procesori, memorje, GPU) për Jupyter Notebook-in e zgjedhur.
Pasi një analist të dhënash krijon dhe përshtat një notebook, të gjitha shqetësimet e tjera për të merret me planifikuesin e Kubernetes-it, i cili është pjesë e OpenShift. Përdoruesve u mbetet thjesht të kryejnë eksperimentet e tyre, të ruajnë dhe të ndajnë rezultatet e punës së tyre. Për më tepër, përdoruesit e avancuar mund të aksesojnë drejtpërdrejt shell-in CLI të OpenShift nga Jupyter notebooks, për të angazhuar primitivët e Kubernetes, siç janë Job, ose funksionalitetin e OpenShift, si Tekton ose Knative. Alternativisht, mund të përdorin GUI-në e thjeshtë të OpenShift, e cila quhet "konsola e uebit të OpenShift."


Duke kaluar në fazën tjetër, Open Data Hub ofron mundësinë për të menaxhuar konvejerët e të dhënave (data pipelines). Për këtë përdoret objekti Ceph, i cili ofrohet si një ruajtje e dhënave e përputhshme me S3. Apache Spark mundëson transmetimin e të dhënave nga burime të jashtme ose ruajtja e brendshme e Ceph S3, si dhe kryerjen e transformimeve të parapara të të dhënave. Apache Kafka ofron menaxhim të zgjeruar të konvejerëve të të dhënave (ku mund të kryhen ngarkesa të shumëfishta, si dhe operacione transformimi, analize dhe ruajtjeje të të dhënave).
Pra, analisti i të dhënave ka akses në të dhënat dhe ka ndërtuar modelin. Tani ai dëshiron të ndajë rezultatet e marra me kolegët ose zhvilluesit e aplikacioneve, duke u ofruar atyre modelin e tij sipas parimeve të shërbimit. Për këtë, nevojitet një server i daljes, dhe Open Data Hub ka një server të tillë, i quajtur Seldon, që lejon publikimin e modelit si një shërbim RESTful.
Në një moment, në serverin Seldon, ka disa modele të tilla dhe lind nevoja për të monitoruar se si përdoren ato. Për këtë, Open Data Hub ofron një koleksion të metrikave përkatëse dhe një motor raportimi të bazuar në mjetet e njohura të monitorimit me kod të hapur Prometheus dhe Grafana. Si rezultat, ne marrim informacion për monitorimin e përdorimit të modeleve të AI, veçanërisht në mjedisin e prodhimit.

Kështu, Open Data Hub siguron një qasje si në cloud gjatë gjithë ciklit të operacioneve të AI/ML, duke filluar nga qasja dhe përgatitja e të dhënave deri te trajnimi dhe përdorimi industrial i modelit.
Mbledhim gjithçka së bashku
Tani lind pyetja, si mund ta organizojë administratorit të OpenShift gjithë këtë. Dhe këtu hyjnor një operator i veçantë Kubernetes për projektet Open Data Hub.

Ky operator menaxhon instalimin, konfigurimin dhe ciklin e jetës së projektit Open Data Hub, përfshirë vendosjen e mjeteve të përmendura më lart, si JupyterHub, Ceph, Spark, Kafka, Seldon, Prometheus dhe Grafana. Projekti Open Data Hub mund të gjendet në konsolën e uebit OpenShift, në seksionin e operatorëve të komunitetit. Kështu, administratorët e OpenShift mund të specifikojnë që projektet përkatëse të OpenShift janë të kategorisë 'projekt Open Data Hub'. Kjo bëhet një herë. Pas kësaj, analisti i të dhënave përmes konsolës së uebit OpenShift hyn në hapësirën e tij të projektit dhe sheh që për projektet e tij është instaluar dhe është në dispozicion operatori përkatës Kubernetes. Pastaj ai krijon një instancë të projektit Open Data Hub me një klikim dhe menjëherë merr qasje në mjetet e përshkruara më lart. Dhe gjithë kjo mund të konfigurohet në një mënyrë me disponueshmëri të lartë dhe qëndresë ndaj dështimeve.

NĂ«se dĂ«shiron tĂ« provosh me duar projektin Open Data Hub, fillo me . Detajet teknike tĂ« arkitekturĂ«s sĂ« Open Data Hub mund tĂ« gjenden , planet pĂ«r zhvillimin e projektit â . NĂ« tĂ« ardhmen, planifikohet tĂ« realizohet njĂ« integrim shtesĂ« me Kubeflow, tĂ« zgjidhen disa pyetje lidhur me rregullimin e tĂ« dhĂ«nave dhe sigurinĂ«, si dhe tĂ« organizohet integrimi me sistemet e bazuara nĂ« rregulla Drools dhe Optaplanner. TĂ« shprehĂ«sh mendimin tĂ«nd dhe tĂ« bĂ«hesh pjesĂ« e projektit mund tĂ« bĂ«het nĂ« faqen .
Në përmbledhje: problemet serioze me shkallëzimin e pengojnë organizatat të shfrytëzojnë plotësisht potencialin e inteligjencës artificiale dhe mësimit të makinerive. Red Hat OpenShift është përdorur prej kohësh dhe me sukses për të zgjidhur probleme të ngjashme në industrinë e softuerit. Projekti Open Data Hub, i zbatuar në kuadër të komunitetit të zhvillimit me kod të hapur, ofron një arkitekturë standarde për organizimin e ciklit të plotë të operacioneve AI/ML mbi bazën e cloud-it hibrid OpenShift. Ne kemi një plan të qartë dhe të mirëfilltë për zhvillimin e këtij projekti dhe jemi seriozisht të vendosur për të krijuar një komunitet aktiv dhe produktiv të zhvilluesve të zgjidhjeve të hapura AI në platformën OpenShift.
Burimi: habr.com
