Kërkuesit nga Universiteti Nijmegen (Holandë) përgatitën një renditje të hapjes së 40 modeleve të mëdha të gjuhës dhe 7 modele të gjenerimit të imazheve nga përshkrimi tekstual, të cilat shpallen nga prodhuesit si të hapura. Për shkak të faktit se kriteret e hapjes së modeleve të mësimit të makinerisë ende po formohen, aktualisht ka një situatë ku modelet me licencë që kufizon përdorimin shpërndahen nën petkun e hapura (p.sh., shumë modele ndalojnë përdorimin në projekte komerciale). Gjithashtu shpesh prodhuesit nuk ofrojnë akses në të dhënat e përdorura për trajnimin, nuk zbulojnë detajet e zbatimit ose nuk e hapin krejtësisht kodin përkatës.
Shumica e modeleve që pozicionohen si "të hapura", në të vërtetë duhet të interpretohen si "peshë të hapura" ose më saktë "peshë të disponueshme", pasi ato shpërndahen nën licenca kufizuese që ndalojnë përdorimin në produkte komerciale. Kërkuesit e pavarur mund të eksperimentojnë me këto modele, por nuk kanë mundësi të adaptojnë modelin për nevojat e tyre ose të inspektojnë zbatimin. Më shumë se gjysma e modeleve nuk ofrojnë detaje të hollësishme mbi të dhënat e përdorura për trajnimin, si dhe nuk publikojnë informacion mbi strukturën dhe arkitekturën e brendshme.
Modelet më të hapura janë njohur si BloomZ, AmberChat, OLMo, Open Assistant dhe Stable Diffusion, të cilat janë publikuar nën licenca të hapura së bashku me të dhëna burimore, kod dhe zbatim API. Modelet nga Google (Gemma 7B), Microsoft (Orca 2) dhe Meta (Llama 3), të cilat pozicionohen nga prodhuesit si të hapura, rezultuan më afër fundin e renditjes, pasi ata nuk ofrojnë akses në të dhënat burimore, nuk zbulojnë detajet teknike të zbatimit, dhe peshat e modelit shpërndahen nën licenca që kufizojnë përdorimin. Modeli i njohur Mistral 7B doli rreth në mes të renditjes, pasi ofrohet nën një licencë të hapur, por është vetëm pjesërisht i dokumentuar, nuk zbulon të dhënat e përdorura për trajnimin dhe ka kodin e shoqërues që nuk është plotësisht i hapur.
Kërkuesit propozuan 14 kritere për hapjen e modeleve të AI, që mbulojnë kushtet e shpërndarjes së kodit, të dhënave për trajnim, peshave të modelit, varianteve të të dhënave dhe peshave të optimizuara përmes të mësuarit me mbështetje (RL), si dhe ekzistencën e paketave të gatshme për përdorim, API, dokumentacionit dhe përshkrimeve të detajuara të zbatimit.


Përputhshëm me propozimin e organizatës OSI (Open Source Initiative) për një version paraprak të definicionit të AI të hapur, kriteret kryesore për hapjen e sistemit AI janë ofrimi i mundësive për përdorim për çdo qëllim pa nevojën për leje të veçantë; studimi i funksionimit të sistemit dhe inspektimi i komponenteve të tij; bërja e ndryshimeve për çfarëdo qëllimi; transferimi të tjerëve si në versionin burimor, ashtu edhe në redaktimin pas ndryshimeve.
Për të ofruar mundësi për të bërë ndryshime, sistemi AI duhet të përfshijë:
- Informacione të detajuara rreth të dhënave të përdorura gjatë trajnimitt dhe metodologjisë së trajnimit. Informacioni duhet të jetë i mjaftueshëm që një zhvillues profesionist të mund të rivendosë një sistem AI ekvivalent me forcat e tij, duke përdorur të njëjtat ose të ngjashmet të dhëna për trajnim.
- Prania e kodit burimor, i cili lejon si nisjen e sistemit AI, ashtu edhe realizimin e procesit të trajnimit (në tabelën e shqyrtuar më sipër, në kolonën "kod", për shumë modele është treguar "~", që nënkupton praninë e pjesshme të kodit, ku kodi është i disponueshëm për nisjen e modelit, por mungon kodi për trajnimin ose krijimin e modelit). Kodi gjithashtu duhet të mbulojë fusha të tilla si përpunimi paraprak, verifikimi i të dhënave dhe tokenizimi. Për më tepër, duhet të ofrohet një përshkrim i detajuar i arkitekturës së modelit.
- Parametrat e modelit (peshat), që nënkuptojnë një prerje të gatshme për përdorim pas trajnimit ose variantin përfundimtar të optimizuar të modelit.
Burimi: opennet.ru
