Projekti Debian shpalli një votim të përgjithshëm (GR, rezolutë e përgjithshme) nga zhvilluesit e projektit për miratimin e kritereve të pranimit të modeleve të mësimit të makinerive në depovishtolën kryesore të projektit. Në këtë fazë, është nisur faza e diskutimit, pas së cilës do të fillojë mbledhja e votave (data e fillimit të votimit ende nuk është caktuar). Të drejtën e votës e kanë rreth një mijë zhvillues, të angazhuar në mbështetje të pakove dhe mirëmbajtjen e infrastrukturës Debian.
ModelĂ«t e AI-sĂ«, qĂ« shpĂ«rndahen nĂ«n licenca tĂ« hapura, por pa ofrimin e materialeve origjinale dhe mjeteve pĂ«r trajnim tĂ« modelit, propozohen tĂ« njihet si tĂ« papĂ«rshtatshĂ«m me kriteret e Debian, qĂ« pĂ«rcaktojnĂ« softuerin e lirĂ« (DFSG, Udhezimi pĂ«r Softuerin e LirĂ« Debian). NĂ« rast se propozimi miratohet, modelet e tilla nuk do tĂ« mund tĂ« pĂ«rfshihen nĂ« depovishtolĂ«n kryesore tĂ« projektit (âmainâ). MundĂ«sia e shpĂ«rndarjes sĂ« modeleve tĂ« tilla nĂ« depovishtolat ânon-freeâ nĂ« votimin qĂ« po zhvillohet nuk shqyrtohet.
Disa nga problemet që lindin nga mungesa e të dhënave që përdoren për trajnim, përmenden:
- Mungesa e të dhënave origjinale ose programeve të përdorura për trajnim, e kufizon ndjeshëm mundësitë për modifikimin e modeleve të gatshme të AI-së. Përkundër lejes për modifikim në licencë, në praktikë, një modifikim i tillë është i vështirë. Një ndryshim mund të jetë i nevojshëm, për shembull, kur është e nevojshme të zëvendësohet tokenizatori, i nevojshëm për të shtuar mbështetje për gjuhë të reja.
- Të dhënat e përdorura për trajnim mund të interpretohen si "kod burimi" i modelit, ndërsa modeli i gatshëm si rezultati i përpunimit të këtij "kodi burimor" nga mjetet për trajnim. Prandaj, për modifikimin e plotë të modelit duhet të ketë mundësi modifikimi të të dhënave origjinale dhe mjeteve.
- Mungesa e mundësisë për të rikrijuar punën e realizuar për krijimin e modelit, pa qasje në të dhënat origjinale dhe mjetet.
- Siguria dhe çështjet etike. Pa të dhënat burimore dhe mjetet, mundësia për të eliminuar dobësitë në modelet është e kufizuar nga përdorimi i patch-eve binarë ose zëvendësimi i plotë i modelit. Këto patch-e mund të përgatiten vetëm nga autori i modelit, dhe konsumatorët e modelit bëhen plotësisht të varur nga ai. Në të njëjtën kohë, askush, duke përfshirë autorët e modelit, nuk është në gjendje të kuptojë thelbin e ndryshimeve të ofruara në këtë mënyrë. Mungesa e të dhënave burimore gjithashtu e vështirëson identifikimin e vënies së backdoor-ëve në modelet e mësimit të makinerisë.
- Kufizimet në studim. Pa të dhënat burimore, është e pamundur të konfirmohet se modeli është trajnuar me të dhëna që ofrohen nën licenca që lejojnë një përdorim të tillë, ose të përjashtohet se gjatë trajnimit nuk janë përdorur të dhëna të marra në mënyrë të paligjshme. Për më tepër, nëse gjatë trajnimit janë përdorur të dhëna nën licencën GPL, mund të nevojitet analiza e pranisë së fragmenteve me kopje të këtyre të dhënave në rezultatet e modelit, për të cilat nevojitet përmendja e burimit dhe licencës. Zhvilluesi mund të shtojë në projektin e tij kode/ përmbajtje të gjeneruara nga modeli dhe pa e dashur të shkelë licencën për disa nga të dhënat burimore.
Në tetor të vitit të kaluar, organizata OSI (Open Source Initiative) publikoi një definicion për sistemin e hapur të AI (Open Source AI). Një sistem i hapur AI duhet të ofrojë mundësitë e mëposhtme: përdorim për qëllime të çdo lloji pa pasur nevojë për leje të veçantë; studimin e funksionimit të sistemit dhe inspektimin e komponenteve të tij; bëri ndryshime për çdo qëllim; transferimin e palëve të treta si versionin origjinal ashtu edhe redaktimin pas ndryshimeve, pa kufizime në qëllimet e përdorimit. Një sistem i hapur AI duhet të përfshijë informacion të detajuar mbi arkitekturën e modelit, të dhënat e përdorura gjatë trajnimit dhe metodologjinë e trajnimit, si dhe kodin burimor për të drejtuar dhe trajnuar sistemin AI. Informacioni duhet të jetë mjaftueshëm që një zhvillues profesionist të mund të riprodhojë një sistem të barabartë AI, duke përdorur të njëjtat ose të ngjashme të dhëna për trajnim.
Organizata pĂ«r Mbrojtjen e LirisĂ« Softuerike (SFC) kritikoi njĂ« pĂ«rkufizim tĂ« tillĂ«. PakĂ«naqĂ«sia Ă«shtĂ« shkaktuar nga fakti se nĂ« kriteret mungojnĂ« kĂ«rkesat pĂ«r dhĂ«nien e tĂ« dhĂ«nave qĂ« janĂ« pĂ«rdorur pĂ«r tĂ« trajnuar modelin. NĂ« pĂ«rkufizimin OSI kĂ«rkohet vetĂ«m dhĂ«nia e informacionit tĂ« detajuar mbi tĂ« dhĂ«nat e pĂ«rdorura pĂ«r trajnim, por jo tĂ« dhĂ«nat vetĂ«. PĂ«rkufizimi i pranuar garanton vetĂ«m dy nga katĂ«r liritĂ« e shpallura Open Source â mundĂ«sinĂ« pĂ«r ta pĂ«rdorur dhe pĂ«r ta shpĂ«rndarĂ«, pĂ«rderisa mundĂ«sitĂ« pĂ«r ta ndryshuar dhe pĂ«r ta studiuar nuk janĂ« plotĂ«sisht tĂ« sigurta.
Vendimi i OSI shpjegohet me faktin se publikimi i të dhënave origjinale në shumë raste është i pamundur për arsye që nuk varen nga zhvilluesi i modelit AI, siç janë nevoja për ruajtjen e privatësisë, përdorimi i materialeve të mbrojtura nga e drejta e autorit, licencimi i të dhënave nga furnizues të tretë etj. Në rast se do të shtohej kërkesa për ofrimin e të dhënave, asnjë nga modelet e gjuhëve të mëdha ekzistuese nuk do të merrte statusin e hapur, dhe përkufizimi vetë do të bëhej një utopi e paqenë.
Burimi: opennet.ru
