SUSE ha annunciato l'apertura sotto licenza Apache 2.0 di un grande modello linguistico Cavil-Qwen3-4B, utilizzato nei progetti SUSE e openSUSE all'interno dello strumento Cavil per l'analisi della pulizia delle licenze del codice. Il modello pubblicato comprende 4 miliardi di parametri ed è basato sul modello Qwen3-4B, ottimizzato ulteriormente per la classificazione del testo.
La principale funzione del modello è la determinazione delle licenze utilizzate nel codice sorgente dei programmi e nella documentazione. Per eseguire questa operazione, il modello è stato ulteriormente addestrato su un set di dati che include 150.000 esempi di intestazioni e commenti con riferimenti alle licenze nel codice sorgente. Nella pratica, il modello consente di automatizzare la verifica della pulizia delle licenze della base di codice per identificare incompatibilità di licenze e potenziali problemi legali con il codice.
La dimensione del modello è stata scelta per raggiungere un equilibrio tra una comprensione qualitativa delle strutture linguistiche e la possibilità di funzionare su sistemi con GPU consumer standard. Oltre al modello stesso, è disponibile un set di dati utilizzato durante l'addestramento e uno strumento per la validazione. È anche disponibile un gestore per l'utilizzo del modello all'interno dello strumento Cavil, destinato a verificare il codice sorgente in base alla conformità alle normative legali e ai requisiti (verifica delle licenze, identificazione delle violazioni delle licenze, valutazione dei rischi).
Fonte: opennet.ru
