L'organizzazione Open Source Initiative (OSI), che si occupa della verifica delle licenze per la conformità ai criteri Open Source, ha approvato il documento Open Source AI Definition v1.0 (OSAID), nel quale è stata formulata una definizione di AI aperto. Un sistema AI può essere considerato aperto se soddisfa i seguenti criteri:
- Possibilità di utilizzo per qualsiasi scopo senza necessità di ottenere un permesso separato;
- Possibilità di studiare il funzionamento del sistema e ispezionare i suoi componenti;
- Possibilità di apportare modifiche per qualsiasi scopo, compreso il cambiamento delle informazioni fornite dal sistema;
- Possibilità di trasferire ad altri sia la versione originale che le sue modifiche, senza limitazioni sugli scopi di utilizzo.
Per consentire la possibilità di modifiche, un sistema AI aperto deve includere:
- Informazioni dettagliate sui dati utilizzati per l'addestramento e sulla metodologia di apprendimento. Le informazioni devono essere sufficienti affinché uno sviluppatore professionista possa ricreare autonomamente un sistema AI equivalente, utilizzando gli stessi dati o dati simili per l'addestramento.
- Codice sorgente che consenta sia di eseguire il sistema AI, sia di svolgere il processo di apprendimento. Il codice deve coprire anche aree come la pre-elaborazione, la verifica dei dati e la tokenizzazione. Inoltre, deve essere fornita una descrizione dettagliata dell'architettura del modello.
- I parametri del modello (pesi) implicano la disponibilità di uno stato di taglio pronto all'uso dopo l'addestramento o la presenza di una versione finale ottimizzata del modello.
Grandi modelli linguistici di machine learning, riconosciuti come conformi ai criteri stabiliti: Pythia (Eleuther AI), OLMo (AI2), Amber (LLM360), CrystalCoder (LLM360) e T5 (Google).
Grandi modelli linguistici di machine learning che aspirano a essere conformi, ma richiedono modifiche alle licenze o alle norme di utilizzo: BLOOM (BigScience), Starcoder2 (BigCode) e Falcon (TII).
Grandi modelli linguistici di machine learning, riconosciuti come non conformi ai criteri dei sistemi AI aperti, a causa della mancanza dei componenti necessari o per via di requisiti incompatibili con i principi Open Source: Llama2 (Meta), Grok (X/Twitter), Phi-2 (Microsoft) e Mixtral (Mistral).
Fonte: opennet.ru
