Proiectul Debian a început votul general privind criteriile de deschidere a modelelor AI.

Proiectul Debian a anunțat organizarea unui vot general (GR, rezoluție generală) pentru dezvoltatorii proiectului, pentru aprobarea criteriilor de acceptare a modelelor de învățare automată în depozitul principal al proiectului. În această etapă, a fost lansată faza de discuție, după care va începe colectarea voturilor (data de început a votului nu a fost încă stabilită). Aproximativ o mie de dezvoltatori, care participă la întreținerea pachetelor și la suportul infrastructurii Debian, au drept de vot.

Modelele AI distribuite sub licențe deschise, dar fără furnizarea materialului sursă și a instrumentarului pentru antrenarea modelului, sunt propuse a fi considerate incompatibile cu criteriile Debian care definesc software-ul liber (DFSG, Debian Free Software Guideline). În cazul aprobării propunerii, astfel de modele nu vor putea fi incluse în depozitul principal al proiectului („main”). Posibilitatea livrării acestor modele în depozitele „non-free” nu este considerată în votul desfășurat.

Printre problemele menționate ca rezultat al absenței datelor folosite în timpul antrenării se numără:

  • Lipsa datelor sursă sau a programelor folosite pentru antrenare limitează drastic capacitățile de modificare a modelelor AI existente. Deși licența permite modificarea, în practică, această modificare este dificil de realizat. Este posibil să fie necesară modificarea, de exemplu, în cazul în care este nevoie de înlocuirea tokenizatorului, necesar pentru adăugarea suportului pentru noi limbi.
  • Datele utilizate pentru antrenare pot fi considerate „cod sursă” al modelului, iar modelul final ca rezultatul prelucrării acestui „cod sursă” prin instrumentarul de antrenare. Prin urmare, pentru o modificare completă a modelului, ar trebui să existe posibilitatea de a modifica datele sursă și instrumentarul.
  • Imposibilitatea de a reproduce lucrările efectuate pentru crearea modelului, fără acces la datele sursă și instrumentar.
  • Securitate și aspecte etice. Fără datele sursă și instrumentele necesare, posibilitatea de a remedia vulnerabilitățile în modele este limitată la aplicarea patch-urilor binare sau la înlocuirea completă a modelului. Aceste patch-uri pot fi pregătite doar de autorul modelului, iar utilizatorii modelului devin complet dependenți de acesta. În același timp, nimeni, inclusiv autorii modelului, nu este capabil să înțeleagă esența modificărilor propuse în acest mod. Absenta datelor sursă îngreunează, de asemenea, identificarea înlocuirii backdoor-urilor în modelele de învățare automată.
  • Restricții în studii. Fără datele sursă, nu este posibil să se confirme că modelul a fost antrenat pe date oferite sub licențe care permit astfel de utilizări, sau să se excludă că în timpul antrenării nu au fost utilizate date obținute ilegal. În plus, dacă în timpul antrenării au fost folosite date sub licența GPL, poate fi necesar să se analizeze prezența în rezultatul oferit de model a unor fragmente cu o copie a acestor date, pentru care este necesar să se menționeze sursa și licența. Dezvoltatorul poate adăuga în proiectul său cod/content generat de model și, fără intenție, să încalce licența pentru unele date sursă.

În octombrie anul trecut, organizația OSI (Open Source Initiative) a publicat definiția unui sistem AI deschis (Open Source AI). Un sistem AI deschis trebuie să ofere următoarele oportunități: utilizare în orice scopuri fără a necesita obținerea unei permisiuni separate; studierea funcționării sistemului și inspectarea componentelor acestuia; efectuarea de modificări în scopuri variate; transferul către alte persoane atât a variantei originale, cât și a versiunii editate după efectuarea modificărilor, fără limitarea scopurilor de utilizare. Un sistem AI deschis trebuie să includă informații detaliate despre arhitectura modelului, datele utilizate în timpul antrenării și metodologia de antrenare, precum și codul sursă pentru rularea și antrenarea sistemului AI. Informațiile trebuie să fie suficiente pentru ca un dezvoltator profesionist să poată recrea o sistem AI echivalent, folosind aceleași date sau date similare pentru antrenare.

Organizația de apărare a drepturilor Software Freedom Conservancy (SFC) a criticat o astfel de definiție. Nemulțumirea este cauzată de absența cerințelor privind furnizarea datelor utilizate pentru antrenarea modelului. În definiția OSI, este necesară doar furnizarea de informații detaliate despre datele utilizate în antrenare, dar nu și a datelor în sine. Definiția acceptată garantează doar două dintre cele patru libertăți declarate Open Source — posibilitatea de a folosi și de a distribui, în timp ce posibilitățile de a modifica și de a studia nu sunt complet asigurate.

Decizia OSI este explicată prin faptul că publicarea datelor sursă este imposibilă în multe cazuri din motive care nu depind de dezvoltatorul modelului AI, cum ar fi necesitatea de a păstra confidențialitatea, utilizarea materialelor protejate prin drepturi de autor, licențierea datelor de la furnizori terți etc. Dacă s-ar adăuga cerințe pentru furnizarea datelor, niciunul dintre modelele de limbaj mari existente nu ar obține statutul de open source, iar definiția însăși ar deveni o utopie inaccesibilă.

Sursa: opennet.ro

Cumpără un hosting fiabil pentru site-uri cu protecție DDoS, servere VPS VDS 🔥 Cumpără un hosting fiabil pentru site-uri cu protecție DDoS, servere VPS VDS | ProHoster