Projekti Debian njoftoi për një votim të përgjithshëm (GR, rezoluta e përgjithshme) nga zhvilluesit e projektit për miratimin e kritereve të pranimit të modeleve të mësimit të makinerisë në depozitën kryesore të projektit. Në këtë fazë, është nisur diskutimi, pas së cilës do të fillojë mbledhja e votave (data e fillimit të votimit ende nuk është përcaktuar). Të drejtën e votës e kanë rreth një mijë zhvillues që përfshihen në mbështetje të paketave dhe mirëmbajtjen e infrastrukturës Debian.
Modelet AI, që shpërndahen nën licenca të hapura, por pa ofruar materialin burimor dhe mjetet për trajnimin e modelit, propozohet të njihen si të papajtueshme me kriteret e Debian, që përcaktojnë softuerin e lirë (DFSG, Direktivë për Softuerin e Lirë të Debian). Në rastin e miratimit të propozimit, modelet e tilla nuk do të kenë mundësi të përfshihen në depozitën kryesore të projektit («main»). Mundësia e ofrimit të modeleve të tilla në depozitat «non-free» në votimin e nisur nuk shqyrtohet.
Mes problemeve që paraqiten në mungesë të të dhënave të përdorura gjatë trajnimit, përmenden:
- Mungesa e të dhënave burimore ose programeve që përdoren për trajnimin e modelit, kufizon shumë mundësitë për modifikimin e modeleve të përfunduara AI. Megjithëse licenca lejon modifikimin, në praktikë kjo është e vështirë. Modifikimi mund të jetë i nevojshëm, për shembull, në rastin e zëvendësimit të tokenizatorit të nevojshëm për shtimin e mbështetjes për gjuhë të reja.
- Të dhënat e përdorura për trajnimin e modelit mund të interpretohen si «kode burimore» të modelit, ndërsa modeli i gatshëm si rezultat i përpunimit të kësaj «kode burimore» me mjetet për trajnim. Prandaj, për një modifikim të plotë të modelit duhet të ekzistojë mundësia për modifikimin e të dhënave burimore dhe mjeteve.
- Pamundësia për të riprodhuar punën e kryer për krijimin e modelit, pa pasur akses në të dhënat burimore dhe mjete.
- Problemet e sigurisë dhe etike. Pa të dhënat burimore dhe mjete, mundësia për të eliminuar vulnerabilitetet në modelet është e kufizuar në përdorimin e patch-eve binare ose zëvendësimin e plotë të modelit. Të tilla patch-e mund të përgatiten vetëm nga autori i modelit, dhe konsumatorët e modelit bëhen plotësisht të varur nga ai. Në të njëjtën kohë, askush, duke përfshirë autorët e modelit, nuk është në gjendje të kuptojë thelbin e ndryshimeve të propozuara në këtë mënyrë. Mungesa e të dhënave burimore gjithashtu e vështirëson identifikimin e vendosjes së backdoore në modelet e mësimit të makinerisë.
- Kufizime në studim. Pa të dhënat burimore, është e pamundur të konfirmohet se modeli është trajnuar me të dhëna të ofruara nën licenca që lejojnë një përdorim të tillë, ose të përjashtohet se gjatë trajnimit nuk janë përdorur të dhëna të marra në mënyrë ilegale. Gjithashtu, nëse gjatë trajnimit janë përdorur të dhëna nën licencën GPL, mund të jetë e nevojshme analiza e ekzistencës në rezultatin e modelit të fragmenteve me kopjen e këtyre të dhënave, për të cilat kërkohet përmendja e burimit dhe licencës. Zhvilluesi mund të shtojë në projektin e tij kod/konten të gjeneruar nga modeli dhe pa dashur të shkelë licencën për disa të dhëna burimore.
Në tetor të vitit të kaluar, organizata OSI (Open Source Initiative) publikoi një përkufizim të sistemit të hapur AI (Open Source AI). Një sistem i hapur AI duhet të ofrojë këto mundësi: përdorim për çdo qëllim pa pasur nevojë për një leje të veçantë; studim i punës së sistemit dhe inspektim i komponenteve të tij; ndryshime për çdo qëllim; transferim të palëve të treta si version burimur, ashtu edhe redaksionin pas ndryshimeve, pa kufizim të qëllimeve të përdorimit. Një sistem i hapur AI duhet të përfshijë informacion të detajuar mbi arkitekturën e modelit, të dhënat e përdorura gjatë trajnimit dhe metodologjinë e trajnimit, si dhe kodin burimor për ekzekutimin dhe trajnimin e sistemit AI. Informacioni duhet të jetë mjaftueshëm për një zhvillues profesional që të jetë në gjendje të rikrijojë një sistem AI ekuivalent, duke përdorur të njëjtat ose të dhëna të ngjashme për trajnimin.
Organizata pĂ«r mbrojtjen e tĂ« drejtave Software Freedom Conservancy (SFC) kritikoi kĂ«tĂ« pĂ«rkufizim. PakĂ«naqĂ«sia Ă«shtĂ« shkaktuar nga fakti se nĂ« kriteret mungojnĂ« kĂ«rkesat pĂ«r ofrimin e tĂ« dhĂ«nave tĂ« pĂ«rdorura pĂ«r trajnimin e modelit. NĂ« pĂ«rkufizimin e OSI, kĂ«rkohet vetĂ«m sigurimi i informacionit tĂ« detajuar mbi tĂ« dhĂ«nat e pĂ«rdorura gjatĂ« trajnimit, dhe jo vetĂ« tĂ« dhĂ«nat. PĂ«rkufizimi i miratuar garanton vetĂ«m dy nga katĂ«r liritĂ« e shpallura tĂ« Open Source â mundĂ«sinĂ« e pĂ«rdorimit dhe mundĂ«sinĂ« e shpĂ«rndarjes, ndĂ«rsa mundĂ«sitĂ« pĂ«r tĂ« modifikuar dhe studiuar nuk janĂ« plotĂ«sisht tĂ« garantuara.
Zgjidhja OSI shpjegohet nga fakti se publikimi i të dhënave burimore në shumë raste është i pamundur për shkak të arsyeve që nuk varen nga zhvilluesi i modelit AI, siç janë nevoja për të ruajtur privatësinë, përdorimi i materialeve të mbrojtura me të drejtat e autorit, licencimi i të dhënave nga furnizues të jashtëm etj. Në rast se do të shtohej një kërkesë për ofrimin e të dhënave, asnjë nga modelet e gjuhës së madhe ekzistuese nuk do të arrinte statusin e hapur, dhe vetë ky përkufizim do të bëhej një utopi e pakapshme.
Burimi: opennet.ru
