Proiectul Open Data Hub – o platformă deschisă de învățare automată bazată pe Red Hat OpenShift

Viitorul a sosit, tehnologiile inteligenței artificiale și învățării automate sunt deja folosite cu succes de magazinele favorite, companiile de transport și chiar fermele care cresc curcani.

Proiectul Open Data Hub – o platformă deschisă de învățare automată bazată pe Red Hat OpenShift

Și dacă ceva există, înseamnă că există deja despre acest lucru pe internet... un proiect deschis! Uitați-vă cum Open Data Hub ajută la scalarea noilor tehnologii și la evitarea dificultăților în implementarea lor.

Cu toate avantajele inteligenței artificiale (artificial intelligence, AI) și învățării automate (machine learning, ML), organizațiile se confruntă adesea cu dificultăți în scalarea acestor tehnologii. Problemele principale sunt, de obicei, următoarele:

  • Schimbul de informații și colaborarea – schimbul de informații fără eforturi suplimentare și colaborarea în regim de iterații rapide sunt practic imposibile.
  • Accesul la date – pentru fiecare sarcină trebuie să fie construit din nou și manual, ceea ce consumă mult timp.
  • Accesul la cerere – nu există posibilitatea de a obține acces la cerere la instrumentele și platforma de învățare automată, precum și la infrastructura de calcul.
  • Producția – modelele rămân în etapa de prototip și nu sunt aduse la exploatarea comercială.
  • Urmărirea și explicarea rezultatelor AI – reproducerea, urmărirea și explicarea rezultatelor AI/ML sunt dificile.

Lăsate nerezolvate, aceste probleme afectează negativ viteza, eficiența și productivitatea profesională a specialiștilor valoroși în procesarea și analiza datelor. Acest lucru duce la frustrare, dezamăgire în muncă și, în final, așteptările afacerii cu privire la AI/ML se pierd.

Responsabilitatea pentru rezolvarea acestor probleme revine specialiștilor IT, care trebuie să ofere analistilor de date – da, ceva asemănător cu un cloud. Dacă extindem subiectul, este nevoie de o platformă care oferă libertate de alegere și acces facil, simplu. În același timp, aceasta ar trebui să fie rapidă, ușor reproiectabilă, scalabilă la cerere și rezistentă la erori. Construirea unei astfel de platforme pe baza tehnologiilor cu sursă deschisă ajută la evitarea dependenței de furnizori și la menținerea unui avantaj strategic pe termen lung în ceea ce privește controlul costurilor.

Acum câțiva ani, ceva similar s-a întâmplat în dezvoltarea aplicațiilor, ducând la apariția microserviciilor, a mediilor cloud hibride, a automatizării IT și a proceselor agile. Pentru a gestiona totul, specialiștii IT au început să folosească containere, Kubernetes și cloud-uri hibride deschise.

Acum, această experiență este aplicată pentru a răspunde provocărilor AI. Astfel, specialiștii IT creează platforme care se bazează pe containere, permit dezvoltarea serviciilor AI/ML în cadrul proceselor agile, accelerează inovațiile și sunt construite având în vedere cloud-ul hibrid.

Proiectul Open Data Hub – o platformă deschisă de învățare automată bazată pe Red Hat OpenShift

Construirea unei astfel de platforme va începe cu Red Hat OpenShift, platforma noastră Kubernetes pentru cloud hibrid, care dispune de un ecosistem în rapidă expansiune de soluții software și hardware pentru ML (NVIDIA, H2O.ai, Starburst, PerceptiLabs etc.). Anumiți clienți Red Hat, cum ar fi BMW Group, ExxonMobil și altele, au desfășurat deja lanțuri de instrumente ML și procese DevOps bazate pe această platformă și ecosistemul său, pentru a duce arhitecturile lor ML în modul de operare industrial și a accelera activitatea analistilor de date.

Un alt motiv pentru care am lansat proiectul Open Data Hub este de a demonstra un exemplu de arhitectură bazată pe mai multe proiecte open-source și a arăta cum se poate realiza întregul ciclu de viață al unei soluții ML pe baza platformei OpenShift.

Proiectul Open Data Hub

Este un proiect open-source care se dezvoltă în cadrul unei comunități de dezvoltare corespunzătoare și realizează întregul ciclu de operațiuni – de la încărcarea și transformarea datelor inițiale până la formarea, antrenarea și întreținerea modelului – în soluționarea sarcinilor AI/ML folosind containere și Kubernetes pe platforma OpenShift. Acest proiect poate fi considerat o implementare de referință, un exemplu despre cum să construiești o soluție deschisă de tip «AI/ML ca serviciu» bazată pe OpenShift și instrumente open-source corespunzătoare, precum Tensorflow, JupyterHub, Spark și altele. Este important de menționat că Red Hat utilizează acest proiect pentru a-și oferi serviciile AI/ML. În plus, OpenShift se integrează cu soluții software și hardware ML cheie de la NVIDIA, Seldon, Starbust și alți furnizori, facilitând construcția și lansarea propriilor sisteme de învățare automată.

Proiectul Open Data Hub – o platformă deschisă de învățare automată bazată pe Red Hat OpenShift

Proiectul Open Data Hub este destinat următoarelor categorii de utilizatori și scenarii de utilizare:

  • Analist de date care are nevoie de o soluție pentru implementarea proiectelor ML, organizată pe un model cloud cu funcții de autoservire.
  • Analist de date care are nevoie de cea mai mare varietate dintr-o gamă largă de instrumente și platforme AI/ML open-source de ultimă generație.
  • Analist de date care are nevoie de acces la surse de date în timpul antrenării modelelor.
  • Analist de date care are nevoie de acces la resurse computaționale (CPU, GPU, memorie).
  • Analist de date care necesită posibilitatea de a colabora și de a împărtăși rezultatele muncii cu colegii, primind feedback și introducând îmbunătățiri prin iterații rapide.
  • Analist de date care dorește să interacționeze cu dezvoltatorii (și echipele devops) pentru ca modelele și rezultatele sale ML să ajungă în producție.
  • Inginer de date care trebuie să ofere analistului de date acces la diverse surse de date, respectând normele și cerințele de securitate.
  • Administrator/operator de sisteme IT care necesită capacitatea de a controla fără efort ciclul de viață (instalare, configurare, actualizare) al componentelor și tehnologiilor open-source. De asemenea, sunt necesare instrumentele adecvate de management și alocare.

Proiectul Open Data Hub reunește o gamă largă de instrumente open-source pentru realizarea ciclului complet al operațiunilor AI/ML. Ca instrument principal de lucru pentru analistul de date, se utilizează Jupyter Notebook. Acest instrument este astăzi foarte popular printre specialiștii în procesarea și analiza datelor, iar Open Data Hub le permite să creeze și să gestioneze cu ușurință spațiile de lucru Jupyter Notebook, folosind JupyterHub încorporat. Pe lângă crearea și importul de notebooks Jupyter, proiectul Open Data Hub conține, de asemenea, o serie de notebooks deja gata, sub formă de bibliotecă AI Library.

Această bibliotecă reprezintă o colecție de componente open-source pentru învățarea automată și soluții pentru scenarii standard, care simplifică prototiparea rapidă. JupyterHub este integrat cu modelul de acces RBAC al OpenShift, permițând utilizarea conturilor OpenShift existente și implementarea unui sistem de autentificare unificată. În plus, JupyterHub oferă o interfață prietenoasă pentru utilizatori numită spawner, cu ajutorul căreia utilizatorul poate configura cu ușurință volumul de resurse computaționale (nuclee de procesor, memorie, GPU) pentru Jupyter Notebook-ul ales.

După ce analistul de date creează și configurează notebook-ul, toate celelalte sarcini sunt preluate de planificatorul Kubernetes, care face parte din OpenShift. Utilizatorii trebuie doar să-și efectueze experimentele, să salveze și să împărtășească rezultatele muncii lor. În plus, utilizatorii avansați pot accesa direct CLI-ul OpenShift din notebook-urile Jupyter pentru a utiliza primitivele Kubernetes, cum ar fi Job, sau funcționalitatea OpenShift, de exemplu Tekton sau Knative. De asemenea, pot utiliza interfața grafică prietenoasă OpenShift, denumită "web console OpenShift".

Proiectul Open Data Hub – o platformă deschisă de învățare automată bazată pe Red Hat OpenShift

Proiectul Open Data Hub – o platformă deschisă de învățare automată bazată pe Red Hat OpenShift

Trecând la etapa următoare, Open Data Hub oferă posibilitatea de a gestiona conductele de date (data pipelines). Acest lucru se realizează prin utilizarea unui obiect Ceph, care este oferit ca un depozit de date compatibil S3. Apache Spark asigură streamingul datelor din surse externe sau din depozitul Ceph S3 încorporat, precum și permite efectuarea unor transformări preliminare ale datelor. Apache Kafka oferă gestionare avansată a conductelor de date (unde se pot efectua încărcări multiple, precum și operațiuni de transformare, analiză și salvare a datelor).

Așadar, analistul de date a obținut acces la date și a construit un model. Acum el dorește să împărtășească rezultatele obținute cu colegii sau dezvoltatorii de aplicații, oferindu-le modelul său pe baza principiilor de tip serviciu. Pentru aceasta, este nevoie de un server de output, iar Open Data Hub are un astfel de server, care se numește Seldon și permite publicarea modelului ca serviciu RESTful.

Într-un moment dat, pe serverul Seldon există mai multe astfel de modele și survine nevoia de a monitoriza cum sunt folosite. Pentru aceasta, Open Data Hub oferă o colecție de metrici relevante și un motor de raportare bazat pe instrumente de monitorizare de uz larg, precum Prometheus și Grafana. Ca rezultat, obținem feedback pentru monitorizarea utilizării modelelor AI, în special în medii de producție.

Proiectul Open Data Hub – o platformă deschisă de învățare automată bazată pe Red Hat OpenShift

Astfel, Open Data Hub asigură o abordare cloud-like pe parcursul întregului ciclu de operațiuni AI/ML, începând cu accesul și prepararea datelor și terminând cu antrenarea și exploatarea modelului în industrie.

Adunăm totul la un loc

Acum apare întrebarea cum să organizeze toate acestea administratorul OpenShift. Și aici intervine un operator special Kubernetes pentru proiectele Open Data Hub.

Proiectul Open Data Hub – o platformă deschisă de învățare automată bazată pe Red Hat OpenShift

Acest operator gestionează instalarea, configurarea și ciclul de viață al proiectului Open Data Hub, inclusiv desfășurarea instrumentelor menționate anterior, cum ar fi JupyterHub, Ceph, Spark, Kafka, Seldon, Prometheus și Grafana. Proiectul Open Data Hub poate fi găsit în consola web OpenShift, la secțiunea operatorilor din comunitate. Astfel, administratorul OpenShift poate specifica că proiectele OpenShift corespunzătoare aparțin categoriei „proiect Open Data Hub”. Aceasta se face o singură dată. După aceea, analistul de date intră în spațiul său de proiect prin consola web OpenShift și vede că operatorul Kubernetes corespunzător este instalat și disponibil pentru proiectele sale. Apoi, acesta creează un exemplu al proiectului Open Data Hub cu un singur clic și primește imediat acces la instrumentele descrise mai sus. Și toate acestea pot fi configurate în moduri de disponibilitate înaltă și reziliență.

Proiectul Open Data Hub – o platformă deschisă de învățare automată bazată pe Red Hat OpenShift

Dacă doriți să încercați proiectul Open Data Hub, începeți cu instrucțiunile de instalare și un tutorial introductiv. Detalii tehnice despre arhitectura Open Data Hub pot fi găsite aici, planurile de dezvoltare ale proiectului – aici. În viitor, se preconizează realizarea unei integrări suplimentare cu Kubeflow, abordarea unor aspecte legate de reglementarea datelor și securitate, precum și organizarea integrării cu sisteme bazate pe reguli Drools și Optaplanner. Părerea dumneavoastră poate fi exprimată și puteți deveni participant la proiectul Open Data Hub pe pagina comunității.

În concluzie: problemele grave de scalabilitate împiedică organizațiile să valorifice pe deplin potențialul inteligenței artificiale și al învățării automate. Red Hat OpenShift este folosit de mult timp cu succes pentru a rezolva probleme similare în industria software-ului. Proiectul Open Data Hub, realizat în cadrul comunității de dezvoltare în cod deschis, oferă o arhitectură de referință pentru organizarea întregului ciclu operațional AI/ML pe baza cloud-ului hibrid OpenShift. Avem un plan de dezvoltare clar și bine gândit pentru acest proiect, iar intenția noastră este de a crea în jurul său o comunitate activă și productivă de dezvoltatori de soluții AI deschise pe platforma OpenShift.

Sursa: habr.com

Cumpără un hosting fiabil pentru site-uri cu protecție DDoS, servere VPS VDS 🔥 Cumpără un hosting fiabil pentru site-uri cu protecție DDoS, servere VPS VDS | ProHoster