L'azienda SUSE ha annunciato il rilascio sotto licenza Apache 2.0 di un grande modello linguistico chiamato Cavil-Qwen3-4B, utilizzato nei progetti SUSE e openSUSE all'interno dello strumento Cavil per analizzare la conformità licenziale del codice. Il modello pubblicato comprende 4 miliardi di parametri ed è basato sul modello Qwen3-4B, ulteriormente ottimizzato per la classificazione del testo.
L'obiettivo principale del modello è identificare le licenze utilizzate nel codice sorgente dei programmi e nella documentazione. Per svolgere questo compito, il modello è stato ulteriormente addestrato su un set di dati che comprende 150.000 esempi di titoli e commenti con riferimenti alle licenze nel codice sorgente. Nella pratica, il modello consente di automatizzare la verifica della conformità licenziale della base di codice per rilevare potenziali incompatibilità licenziali e problemi legali con il codice.
La dimensione del modello è stata scelta per garantire una combinazione di comprensione qualitativa delle strutture linguistiche e la capacità di funzionare su sistemi con GPU consumer di standard. Oltre al modello stesso, è disponibile un insieme di dati utilizzato durante l'addestramento e strumenti per la validazione. È anche disponibile un elaboratore per attivare il modello all'interno degli strumenti Cavil, destinato a controllare il codice sorgente per la conformità alle norme e ai requisiti legali (verifica delle licenze, rilevamento delle violazioni delle licenze, valutazione dei rischi).
Fonte: opennet.ru
