L'organisation Open Source Initiative (OSI), qui se consacre à la vérification des licences pour leur conformité aux critères Open Source, a approuvé le document Open Source AI Definition v1.0 (OSAID), qui définit l'IA ouverte. Un système d'IA peut être considéré comme ouvert s'il respecte les critères suivants :
- Possibilité d'utilisation à des fins variées sans nécessité d'obtenir une autorisation distincte ;
- Possibilité d'examiner le fonctionnement du système et d'inspecter ses composants ;
- Possibilité d'apporter des modifications à des fins variées, y compris des ajustements des informations produites par le système ;
- Possibilité de transmettre aux tiers à la fois la version originale et les modifications apportées, sans limitation des objectifs d'utilisation.
Pour permettre les modifications, un système d'IA ouvert doit inclure :
- Des informations détaillées sur les données utilisées pour l'entraînement et la méthodologie d'entraînement. Les informations doivent suffire à ce qu'un développeur professionnel puisse recréer un système d'IA équivalent, en utilisant les mêmes ou des données similaires pour l'entraînement.
- Le code source permettant à la fois d'exécuter le système d'IA et d'effectuer son processus d'apprentissage. Ce code doit également couvrir des domaines tels que le prétraitement, la vérification des données et la tokenisation. De plus, une description détaillée de l'architecture du modèle doit être fournie.
- Les paramètres du modèle (poids) impliquant la disponibilité d'une tranche d'état prête à l'emploi après l'entraînement ou d'une version finale optimisée du modèle.
De grands modèles de langage d'apprentissage automatique reconnus comme conformes aux critères établis : Pythia (Eleuther AI), OLMo (AI2), Amber (LLM360), CrystalCoder (LLM360) et T5 (Google).
De grands modèles de langage d'apprentissage automatique qui prétendent être conformes, mais nécessitent des modifications des licences ou des règles d'utilisation : BLOOM (BigScience), Starcoder2 (BigCode) et Falcon (TII).
De grands modèles de langage d'apprentissage automatique reconnus comme non conformes aux critères des systèmes d'IA ouverts, en raison de l'absence de composants nécessaires ou de demandes incompatibles avec les principes Open Source : Llama2 (Meta), Grok (X/Twitter), Phi-2 (Microsoft) et Mixtral (Mistral).
Source : opennet.ru
