Projet Open Data Hub – plateforme open source d'apprentissage automatique basĂ©e sur Red Hat OpenShift

L'avenir est arrivĂ©, les technologies de l'intelligence artificielle et de l'apprentissage automatique sont dĂ©jĂ  utilisĂ©es avec succĂšs par vos magasins prĂ©fĂ©rĂ©s, les entreprises de transport et mĂȘme les fermes d'Ă©levage de dindes.

Projet Open Data Hub – plateforme open source d'apprentissage automatique basĂ©e sur Red Hat OpenShift

Et si quelque chose existe, il y a dĂ©jĂ  des informations Ă  ce sujet sur Internet... un projet ouvert ! Voyez comment Open Data Hub aide Ă  intĂ©grer de nouvelles technologies et Ă  Ă©viter les difficultĂ©s lors de leur mise en Ɠuvre.

Malgré tous les avantages de l'intelligence artificielle (IA) et de l'apprentissage automatique (ML), les organisations rencontrent souvent des difficultés pour intégrer ces technologies. Les principaux problÚmes rencontrés sont généralement les suivants :

  • Échange d'informations et collaboration – il est pratiquement impossible d'Ă©changer des informations sans effort supplĂ©mentaire et de collaborer en mode itĂ©ratif rapide.
  • AccĂšs aux donnĂ©es – pour chaque tĂąche, il faut le reconstruire Ă  partir de zĂ©ro et manuellement, ce qui prend beaucoup de temps.
  • AccĂšs Ă  la demande – il n'est pas possible d'obtenir un accĂšs Ă  la demande aux outils et Ă  la plateforme de machine learning, ainsi qu'Ă  l'infrastructure de calcul.
  • Production – les modĂšles restent au stade de prototype et ne sont pas mis en production.
  • Suivi et explication des rĂ©sultats de l'IA – la reproductibilitĂ©, le suivi et l'explication des rĂ©sultats de l'IA/ML sont difficiles.

Si ces problÚmes restent non résolus, ils ont un impact négatif sur la vitesse, l'efficacité et la productivité des précieux spécialistes en traitement et analyse des données. Cela conduit à leur frustration, à une déception au travail, et finalement, les attentes de l'entreprise concernant l'IA/ML s'évaporent.

La responsabilitĂ© de rĂ©soudre ces problĂšmes incombe aux spĂ©cialistes IT, qui doivent fournir aux analystes de donnĂ©es – oui, quelque chose comme le cloud. Plus prĂ©cisĂ©ment, une plateforme qui offre une libertĂ© de choix et un accĂšs facile et simple. En mĂȘme temps, elle devrait ĂȘtre rapide, facilement reconfigurable, scalable Ă  la demande et rĂ©siliente aux pannes. La construction d'une telle plateforme basĂ©e sur des technologies open-source aide Ă  Ă©viter la dĂ©pendance vis-Ă -vis du fournisseur et Ă  prĂ©server un avantage stratĂ©gique Ă  long terme en matiĂšre de contrĂŽle des coĂ»ts.

Il y a quelques années, une situation similaire s'est produite dans le développement d'applications, menant à l'émergence des microservices, des environnements cloud hybrides, de l'automatisation IT et des processus agiles. Pour gérer tout cela, les professionnels de l'IT ont commencé à utiliser des conteneurs, Kubernetes et des clouds hybrides ouverts.

Cette expérience est désormais appliquée pour répondre aux défis de l'IA. Ainsi, les professionnels de l'IT créent des plateformes basées sur des conteneurs, permettant de développer des services AI/ML dans le cadre de processus agiles, accélérant les innovations et conçues avec une vision pour le cloud hybride.

Projet Open Data Hub – plateforme open source d'apprentissage automatique basĂ©e sur Red Hat OpenShift

La construction de cette plateforme débutera avec Red Hat OpenShift, notre plateforme Kubernetes pour le cloud hybride, qui dispose d'un écosystÚme en pleine croissance de solutions logicielles et matérielles pour l'IA/ML (NVIDIA, H2O.ai, Starburst, PerceptiLabs, etc.). Certains clients de Red Hat, tels que BMW Group, ExxonMobil et d'autres, ont déjà déployé des chaßnes d'outils ML conteneurisées et des processus DevOps basés sur cette plateforme et son écosystÚme, afin de mettre leurs architectures ML en mode production et d'accélérer le travail des analystes de données.

Une autre raison pour laquelle nous avons lancé le projet Open Data Hub est de montrer un exemple d'architecture basé sur plusieurs projets de logiciels libres et de démontrer comment réaliser l'ensemble du cycle de vie des solutions ML sur la plateforme OpenShift.

Projet Open Data Hub

C'est un projet open source qui Ă©volue au sein d'une communautĂ© de dĂ©veloppement appropriĂ©e et rĂ©alise l'ensemble du cycle opĂ©rationnel – de l'importation et la transformation des donnĂ©es initiales Ă  la crĂ©ation, Ă  l'entraĂźnement et Ă  la maintenance du modĂšle – pour rĂ©soudre des problĂšmes AI/ML Ă  l'aide de conteneurs et de Kubernetes sur la plateforme OpenShift. Ce projet peut ĂȘtre considĂ©rĂ© comme une mise en Ɠuvre de rĂ©fĂ©rence, un exemple de la façon de construire une solution open source de type 'AI/ML en tant que service' basĂ©e sur OpenShift et les outils open source associĂ©s, tels que Tensorflow, JupyterHub, Spark, etc. Il est important de noter que Red Hat utilise Ă©galement ce projet pour fournir ses services AI/ML. De plus, OpenShift s'intĂšgre aux principales solutions logicielles et matĂ©rielles d'IA/ML de NVIDIA, Seldon, Starburst et d'autres fournisseurs, facilitant ainsi la crĂ©ation et le dĂ©ploiement de ses propres systĂšmes d'apprentissage automatique.

Projet Open Data Hub – plateforme open source d'apprentissage automatique basĂ©e sur Red Hat OpenShift

Le projet Open Data Hub est destiné aux catégories d'utilisateurs et scénarios d'utilisation suivants :

  • Un analyste de donnĂ©es qui a besoin d'une solution de type cloud pour la mise en Ɠuvre de projets ML avec des fonctionnalitĂ©s en libre-service.
  • Un analyste de donnĂ©es qui a besoin du plus large choix parmi la variĂ©tĂ© des derniers outils et plateformes AI/ML open source.
  • Un analyste de donnĂ©es qui a besoin d'accĂšs aux sources de donnĂ©es lors de l'entraĂźnement des modĂšles.
  • Un analyste de donnĂ©es qui a besoin d'accĂšs aux ressources de calcul (CPU, GPU, mĂ©moire).
  • Un analyste de donnĂ©es qui nĂ©cessite la possibilitĂ© de collaborer et de partager ses rĂ©sultats avec ses collĂšgues, de recevoir des retours et d'apporter des amĂ©liorations par des itĂ©rations rapides.
  • Un analyste de donnĂ©es qui souhaite interagir avec les dĂ©veloppeurs (et les Ă©quipes devops) pour que ses modĂšles ML et ses rĂ©sultats passent en production.
  • Un ingĂ©nieur des donnĂ©es qui doit offrir Ă  l'analyste de donnĂ©es un accĂšs Ă  une variĂ©tĂ© de sources de donnĂ©es tout en respectant les normes et exigences de sĂ©curitĂ©.
  • Un administrateur/opĂ©rateur de systĂšmes informatiques qui nĂ©cessite la possibilitĂ© de contrĂŽler sans effort le cycle de vie (installation, configuration, mise Ă  jour) des composants et technologies open source. Des outils de gestion et de quota appropriĂ©s sont Ă©galement nĂ©cessaires.

Le projet Open Data Hub regroupe toute une gamme d'outils open source pour rĂ©aliser un cycle complet d'opĂ©rations AI/ML. Comme principal outil de travail de l'analyste de donnĂ©es, Jupyter Notebook est utilisĂ©. Cet outil est aujourd'hui trĂšs populaire parmi les spĂ©cialistes du traitement et de l'analyse des donnĂ©es, et Open Data Hub leur permet de crĂ©er et de gĂ©rer facilement des environnements de travail Jupyter Notebook, en utilisant le JupyterHub intĂ©grĂ©. En plus de la crĂ©ation et de l'importation de notebooks Jupyter, le projet Open Data Hub contient Ă©galement une bibliothĂšque de notebooks prĂȘts Ă  l'emploi sous forme de bibliothĂšque AI Library.

Cette bibliothĂšque est une collection de composants open-source en apprentissage automatique et de solutions pour des scĂ©narios standards, facilitant le prototypage rapide. JupyterHub est intĂ©grĂ© avec un modĂšle d'accĂšs RBAC d'OpenShift, permettant d'utiliser des comptes OpenShift existants et de rĂ©aliser une authentification unique. De plus, JupyterHub propose une interface utilisateur conviviale appelĂ©e spawner, qui permet Ă  l'utilisateur de configurer facilement la quantitĂ© de ressources de calcul (cƓurs de processeur, mĂ©moire, GPU) pour le Jupyter Notebook sĂ©lectionnĂ©.

Une fois qu'un analyste de données a créé et configuré un notebook, toutes les autres préoccupations sont prises en charge par le planificateur Kubernetes, qui fait partie d'OpenShift. Les utilisateurs n'ont plus qu'à réaliser leurs expériences, sauvegarder et partager les résultats de leur travail. De plus, les utilisateurs avancés peuvent accéder directement à la CLI OpenShift depuis les notebooks Jupyter pour exploiter les primitives Kubernetes, telles que Job, ou les fonctionnalités d'OpenShift, comme Tekton ou Knative. Alternativement, ils peuvent utiliser l'interface graphique conviviale d'OpenShift appelée « console web d'OpenShift ».

Projet Open Data Hub – plateforme open source d'apprentissage automatique basĂ©e sur Red Hat OpenShift

Projet Open Data Hub – plateforme open source d'apprentissage automatique basĂ©e sur Red Hat OpenShift

Passant Ă  l'Ă©tape suivante, Open Data Hub permet de gĂ©rer des pipelines de donnĂ©es. Pour cela, un objet Ceph est utilisĂ©, fourni sous la forme d'un stockage d'objets compatible S3. Apache Spark permet le streaming de donnĂ©es provenant de sources externes ou du stockage Ceph S3 intĂ©grĂ©, ainsi que l'exĂ©cution de transformations de donnĂ©es prĂ©liminaires. Apache Kafka offre une gestion avancĂ©e des pipelines de donnĂ©es (oĂč il est possible de charger plusieurs fois, ainsi que d'effectuer des opĂ©rations de transformation, d'analyse et de sauvegarde des donnĂ©es).

Ainsi, l'analyste de données a eu accÚs aux données et a construit son modÚle. Il souhaite maintenant partager les résultats obtenus avec ses collÚgues ou les développeurs d'applications, en leur fournissant son modÚle en tant que service. Pour cela, un serveur de déploiement est nécessaire, et Open Data Hub dispose d'un tel serveur, appelé Seldon, qui permet de publier le modÚle sous la forme d'un service RESTful.

À un moment donnĂ©, plusieurs de ces modĂšles apparaissent sur le serveur Seldon, ce qui crĂ©e le besoin de surveiller leur utilisation. Pour cela, Open Data Hub propose une collection de mĂ©triques pertinentes et un moteur de rapports basĂ© sur des outils de surveillance open source largement utilisĂ©s comme Prometheus et Grafana. Ainsi, nous obtenons des retours pour surveiller l'utilisation des modĂšles d'IA, en particulier dans un environnement de production.

Projet Open Data Hub – plateforme open source d'apprentissage automatique basĂ©e sur Red Hat OpenShift

De cette maniÚre, Open Data Hub adopte une approche cloud à travers le cycle complet des opérations AI/ML, depuis l'accÚs et la préparation des données jusqu'à l'entraßnement et la mise en production du modÚle.

Rassemblons tout

La question se pose alors de savoir comment tout cela est organisé pour l'administrateur OpenShift. C'est ici qu'entrent en jeu un opérateur Kubernetes spécialisé pour les projets Open Data Hub.

Projet Open Data Hub – plateforme open source d'apprentissage automatique basĂ©e sur Red Hat OpenShift

Cet opĂ©rateur gĂšre l'installation, la configuration et le cycle de vie du projet Open Data Hub, y compris le dĂ©ploiement d'outils tels que JupyterHub, Ceph, Spark, Kafka, Seldon, Prometheus et Grafana. Le projet Open Data Hub peut ĂȘtre trouvĂ© dans la console web d'OpenShift, dans la section des opĂ©rateurs communautaires. Ainsi, l'administrateur OpenShift peut spĂ©cifier que les projets OpenShift concernĂ©s appartiennent Ă  la catĂ©gorie « projet Open Data Hub ». Cela se fait une seule fois. Ensuite, l'analyste de donnĂ©es, via la console web d'OpenShift, accĂšde Ă  son espace projet et constate que l'opĂ©rateur Kubernetes concernĂ© est installĂ© et disponible pour ses projets. Il crĂ©e ensuite un exemplaire du projet Open Data Hub en un clic et a immĂ©diatement accĂšs aux outils dĂ©crits ci-dessus. Et tout cela peut ĂȘtre configurĂ© en mode haute disponibilitĂ© et rĂ©silience.

Projet Open Data Hub – plateforme open source d'apprentissage automatique basĂ©e sur Red Hat OpenShift

Si vous souhaitez essayer le projet Open Data Hub par vous-mĂȘme, commencez par les instructions d'installation et le tutoriel d'introduction. Les dĂ©tails techniques de l'architecture d'Open Data Hub peuvent ĂȘtre trouvĂ©s ici, les plans de dĂ©veloppement du projet – ici. À l'avenir, une intĂ©gration supplĂ©mentaire avec Kubeflow est prĂ©vue, ainsi que la rĂ©solution de certaines questions de rĂ©glementation des donnĂ©es et de sĂ©curitĂ©, et l'organisation d'une intĂ©gration avec des systĂšmes basĂ©s sur les rĂšgles Drools et Optaplanner. Vous pouvez exprimer votre avis et devenir participant au projet Open Data Hub sur la page de la communautĂ©.

En rĂ©sumĂ© : des problĂšmes majeurs d'Ă©volutivitĂ© empĂȘchent les organisations de tirer pleinement parti du potentiel de l'intelligence artificielle et de l'apprentissage automatique. Red Hat OpenShift est utilisĂ© depuis longtemps et avec succĂšs pour rĂ©soudre des problĂšmes similaires dans le secteur des logiciels. Le projet Open Data Hub, dĂ©veloppĂ© au sein de la communautĂ© de dĂ©veloppement open source, propose une architecture de rĂ©fĂ©rence pour organiser le cycle complet des opĂ©rations AI/ML sur la base du cloud hybride OpenShift. Nous avons un plan de dĂ©veloppement clair et rĂ©flĂ©chi pour ce projet, et nous sommes dĂ©terminĂ©s Ă  crĂ©er autour de lui une communautĂ© de dĂ©veloppement active et productive d'AI solutions open sur la plateforme OpenShift.

Source : habr.com

Acheter un hĂ©bergement fiable pour les sites avec protection DDoS, serveurs VPS VDS đŸ”„ Acheter un hĂ©bergement fiable pour les sites avec protection DDoS, serveurs VPS VDS | ProHoster