Bradley M. Kuhn, directeur exécutif et cofondateur de l'organisation de défense Software Freedom Conservancy (SFC), a critiqué la définition d'un système AI open source récemment publiée par l'organisation OSI (Open Source Initiative). Selon Kuhn, l'OSI a précipité la publication de la version finale de la définition et l'a approuvée sans un long débat approfondi, à un stade précoce de l'émergence de tels systèmes. En comparaison, la définition de l'Open Source a été donnée après de nombreuses années de réflexion et de discussions. Concernant la définition publiée du système AI open source, à ce stade, elle aurait dû être qualifiée de recommandation plutôt que de définition.
Kuhn craint que les critères actuels d'open AI, s'ils restent en l'état, aient des conséquences de grande portée, sapent l'autorité du terme Open Source et mènent à la division de la communauté. Le problème est que, malgré les objections, l'organisation OSI a trouvé un compromis et n'a pas inclus l'exigence de fournir les données utilisées pour entraîner le modèle. La raison de ce compromis est que si un tel point était ajouté, aucun des grands modèles linguistiques existants ne pourrait obtenir le statut d'open.
Selon l'OSI, établir une définition d'un système AI open source, tenant compte des réalités établies, permettra d'empêcher les fabricants de manipuler le terme "ouvert", qui, dans des conditions d'incertitude, désignent simplement comme ouverts des modèles sur la base de la disponibilité des coefficients de poids, même si la licence sur le modèle restreint son utilisation (par exemple, de nombreux modèles interdisent une application dans des projets commerciaux) et ne divulguent pas les détails de mise en œuvre.
Dans la définition d'un système AI open source approuvée par l'OSI, il est seulement requis de fournir des informations détaillées sur les données utilisées pour l'entraînement, mais pas les données elles-mêmes. Cependant, sans fournir les données sources sur lesquelles le modèle a été entraîné, il est impossible de reproduire complètement le système AI, ce qui va à l'encontre du concept de code source ouvert. Ainsi, l'organisation OSI s'est limitée à considérer le modèle AI uniquement comme une technologie et n'a pas considéré ceux-ci comme un produit cohérent.
La définition actuellement acceptée d'un système AI open source ne garantit en réalité que deux des quatre libertés déclarées Open Source : la possibilité d'utiliser et de distribuer, tandis que les capacités de modification et d'étude ne sont pas pleinement assurées. De plus, l'absence de données sources complique l'identification des substitutions de backdoors dans les modèles d'apprentissage automatique.
D'autre part, la publication des données sources est dans de nombreux cas impossible pour des raisons qui échappent au développeur du modèle AI, telles que la nécessité de préserver la confidentialité, l'utilisation de matériaux protégés par le droit d'auteur, la gestion des licences de données auprès de fournisseurs tiers, etc. Selon les critiques de la définition actuelle, de tels problèmes ne justifient pas la dévaluation du concept d'Open Source.
Bradley Kuhn prévoit de participer aux prochaines élections de direction de l'OSI et de tenter d'entrer au conseil d'administration afin de contester la définition adoptée et de la faire passer au statut de recommandations. En plus de l'organisation Software Freedom Conservancy, certains développeurs du projet Debian ont également exprimé leur désaccord avec la définition du AI open source et ont proposé de tenir un vote général pour attirer l'attention sur le problème. La Free Software Foundation travaille également sur sa propre définition d'un système AI libre, qui inclura une exigence d'accessibilité de toutes les données, tout en reconnaissant l'existence de raisons éthiques qui, dans certains cas, empêchent la divulgation des données (par exemple, si des données médicales ou personnelles ont été utilisées pour l'apprentissage).
Source : opennet.ru
