Le projet Debian a annoncé la tenue d'un vote général (GR, général resolution) des développeurs du projet pour approuver les critères d'acceptation des modèles d'apprentissage automatique dans le référentiel principal du projet. À ce stade, la phase de discussion est lancée, après laquelle le recueil des votes commencera (la date de début du vote n'est pas encore déterminée). Environ mille développeurs, participant à l'accompagnement des paquets et au maintien de l'infrastructure Debian, ont le droit de vote.
Les modèles d'IA distribués sous des licences ouvertes, mais sans fournir les données sources et les outils pour entraîner le modèle, sont proposés pour être reconnus comme incompatibles avec les critères Debian, définissant les logiciels libres (DFSG, Debian Free Software Guideline). Si la proposition est approuvée, ces modèles ne pourront pas être inclus dans le référentiel principal du projet (« main »). La possibilité de fournir de tels modèles dans les référentiels « non-free » n'est pas envisagée dans le vote en cours.
Parmi les problèmes soulevés par l'absence de données utilisées lors de l'entraînement, on mentionne :
- L'absence de données sources ou de programmes utilisés pour l'entraînement limite considérablement les possibilités de modification des modèles d'IA existants. Bien que la licence autorise la modification, en pratique, une telle modification est compliquée. Des changements peuvent être nécessaires, par exemple, pour remplacer un tokenizeur requis pour ajouter le support de nouvelles langues.
- Les données utilisées pour l'entraînement peuvent être considérées comme le « code source » du modèle, et le modèle final comme le résultat du traitement de ce « code source » par les outils d'entraînement. Par conséquent, pour une modification complète du modèle, il doit être possible de modifier les données sources et les outils.
- L'impossibilité de reproduire le travail effectué pour créer le modèle sans accès aux données sources et aux outils.
- Sécurité et questions éthiques. Sans données sources et outils, la possibilité de corriger les vulnérabilités dans les modèles est limitée par l'application de correctifs binaires ou par le remplacement complet du modèle. De tels correctifs ne peuvent être préparés que par l'auteur du modèle, et les utilisateurs du modèle deviennent entièrement dépendants de celui-ci. De plus, personne, y compris les auteurs du modèle, n'est capable de comprendre la nature des modifications proposées de cette manière. L'absence de données sources complique également l'identification des substitutions de backdoors dans les modèles d'apprentissage automatique.
- Restrictions liées à l'apprentissage. Sans données sources, il est impossible de confirmer que le modèle a été entraîné sur des données fournies sous des licences autorisant une telle utilisation, ou d'exclure que des données obtenues de manière illégale n'ont pas été utilisées lors de l'entraînement. De plus, si des données sous licence GPL ont été utilisées lors de l'entraînement, une analyse pourrait être nécessaire pour déterminer la présence dans les résultats fournis par le modèle de fragments copiés de ces données, pour lesquels une mention de la source et de la licence est obligatoire. Le développeur peut intégrer dans son projet du code/contenu généré par le modèle et involontairement violer la licence de certaines données sources.
En octobre de l'année dernière, l'organisation OSI (Open Source Initiative) a publié une définition d'un système d'IA ouverte (Open Source AI). Un système d'IA ouverte doit offrir les possibilités suivantes : utilisation à toutes fins sans nécessiter d'accord spécifique ; étude du fonctionnement du système et inspection de ses composants ; apport de modifications à des fins diverses ; transmission à d'autres personnes sous forme originale, ainsi que sous forme révisée après modifications, sans restriction quant aux fins d'utilisation. Un système d'IA ouverte doit inclure des informations détaillées sur l'architecture du modèle, les données utilisées lors de l'entraînement et la méthodologie d'apprentissage, ainsi que le code source pour exécuter et entraîner le système d'IA. Les informations doivent être suffisantes pour qu'un développeur professionnel puisse recréer par ses propres moyens un système d'IA équivalent, en utilisant les mêmes données ou des données similaires pour l'entraînement.
L'organisation de défense des droits Software Freedom Conservancy (SFC) a critiqué cette définition. Le mécontentement provient du fait que les critères ne contiennent pas d'exigences concernant la fourniture des données utilisées pour former le modèle. La définition de l'OSI exige uniquement d'apporter des informations détaillées sur les données utilisées pour l'entraînement, mais non les données elles-mêmes. La définition adoptée garantit seulement deux des quatre libertés déclarées en Open Source - la possibilité d'utiliser et la possibilité de distribuer, bien que les possibilités de modifier et d'étudier ne soient pas pleinement assurées.
La décision de l'OSI s'explique par le fait que la publication des données sources est souvent impossible pour des raisons indépendantes du développeur du modèle d'IA, telles que la nécessité de préserver la confidentialité, l'utilisation de matériaux protégés par le droit d'auteur, la licence des données auprès de tiers fournisseurs, etc. Si une exigence de fourniture de données était ajoutée, aucun des modèles linguistiques de grande taille existants ne pourrait obtenir le statut d'open source, et la définition elle-même deviendrait une utopie inatteignable.
Source : opennet.ru
