Het Debian-project heeft een algemene stemming (GR, general resolution) van de ontwikkelaars aangekondigd over de goedkeuring van de criteria voor het accepteren van machine learning-modellen in de hoofdrepository van het project. In deze fase is het discussieproces gestart, waarna de stemperiode zal beginnen (de startdatum van de stemming is nog niet bepaald). Ongeveer duizend ontwikkelaars die betrokken zijn bij het onderhoud van pakketten en de infrastructuur van Debian hebben stemrecht.
AI-modellen die onder open licenties worden verspreid, maar zonder de bronmaterialen en tools voor het trainen van het model, worden voorgesteld als niet compatibel met de criteria van Debian die vrij software definiƫren (DFSG, Debian Free Software Guideline). In geval van goedkeuring van het voorstel, kunnen dergelijke modellen niet worden opgenomen in de hoofdrepository van het project ('main'). De mogelijkheid om dergelijke modellen in de 'non-free' repositories te plaatsen wordt in de huidige stemming niet overwogen.
Onder de problemen die optreden door het gebrek aan gegevens die zijn gebruikt bij de training, worden het volgende genoemd:
- Het ontbreken van de brongegevens of programma's die zijn gebruikt voor de training, beperkt de mogelijkheden om de beschikbare AI-modellen te wijzigen ernstig. Ondanks toestemming voor wijzigingen in de licentie, is dergelijke wijziging in de praktijk moeilijk. Wijzigingen kunnen nodig zijn, bijvoorbeeld bij de noodzaak om de tokenizer te vervangen, die nodig is om ondersteuning voor nieuwe talen toe te voegen.
- De gegevens die voor de training worden gebruikt, kunnen worden opgevat als de 'broncode' van het model, en het voltooide model als het resultaat van de verwerking van deze 'broncode' met behulp van de toolset voor het uitvoeren van de training. Dienovereenkomstig moet voor volledige wijziging van het model de mogelijkheid bestaan om zowel de brongegevens als de toolset te wijzigen.
- De onmogelijkheid om het werk dat is uitgevoerd voor het creƫren van het model te reproduceren zonder toegang tot de brongegevens en de toolset.
- Beveiliging en ethische kwesties. Zonder de brondata en tools is de mogelijkheid om kwetsbaarheden in modellen te verhelpen beperkt tot het gebruik van binaire patches of een volledige vervanging van het model. Dergelijke patches kunnen alleen door de auteur van het model worden voorbereid, waardoor de gebruikers van het model volledig afhankelijk van hem worden. Daarbij kan niemand, inclusief de auteurs van het model, de essentie van de voorgestelde wijzigingen begrijpen. Het gebrek aan brondata bemoeilijkt ook het opsporen van backdoors in machine learning-modellen.
- Beperkingen in het onderzoek. Zonder brondata is het onmogelijk te bevestigen dat het model is getraind op data die onder licenties vallen die dergelijk gebruik toestaan, of uit te sluiten dat tijdens de training geen data zijn gebruikt die op illegale wijze zijn verkregen. Bovendien, als bij de training data onder de GPL-licentie zijn gebruikt, kan het nodig zijn om te analyseren of er fragmenten met een kopie van deze data in het resultaat van het model zijn opgenomen, waarvoor bronvermelding en licentie vereist zijn. De ontwikkelaar kan onbewust code/content die door het model is gegenereerd in zijn project opnemen en daarmee een licentie op bepaalde brondata schenden.
In oktober van vorig jaar publiceerde de organisatie OSI (Open Source Initiative) een definitie van een open AI-systeem (Open Source AI). Een open AI-systeem moet de volgende mogelijkheden bieden: gebruik voor elke doeleinden zonder dat aparte toestemming nodig is; studie van de werking van het systeem en inspectie van de componenten; aanpassingen maken voor elk doel; overdracht aan derden van zowel de originele versie als de gewijzigde versie, zonder beperking van gebruiksdoelen. Een open AI-systeem moet gedetailleerde informatie bevatten over de architectuur van het model, de data die zijn gebruikt voor de training, en de trainingsmethodologie, evenals de broncode voor het opstarten en trainen van het AI-systeem. De informatie moet voldoende zijn zodat een professionele ontwikkelaar in staat is om een gelijkwaardige AI-systeem zelfstandig te recreƫren, met dezelfde of soortgelijke data voor training.
De mensenrechtenorganisatie Software Freedom Conservancy (SFC) heeft kritiek geuit op deze definitie. De onvrede is veroorzaakt doordat de criteria geen eisen bevatten voor het verstrekken van de gegevens die zijn gebruikt voor het trainen van het model. In de OSI-definitie is het alleen nodig om gedetailleerde informatie over de gebruikte trainingsgegevens te geven, maar niet de gegevens zelf. De aangenomen definitie garandeert slechts twee van de vier geclaimde vrijheden van Open Source ā het recht om te gebruiken en het recht om te verspreiden, terwijl de mogelijkheden om te wijzigen en te bestuderen niet volledig zijn gewaarborgd.
De beslissing van OSI wordt verklaard door het feit dat publicatie van de oorspronkelijke gegevens in veel gevallen onmogelijk is om redenen die niet afhankelijk zijn van de ontwikkelaar van het AI-model, zoals de noodzaak om privacy te behouden, het gebruik van auteursrechtelijk beschermde materialen, het licentiƫren van gegevens van externe leveranciers, enz. Als er een eis zou worden toegevoegd voor het verstrekken van gegevens, zou geen van de bestaande grote taalmodellen de status van open source hebben gekregen, en zou de definitie zelf een onbereikbare utopie worden.
Bron: opennet.ru
