La empresa SUSE ha anunciado la apertura bajo la licencia Apache 2.0 de un gran modelo lingüístico llamado Cavil-Qwen3-4B, utilizado en proyectos de SUSE y openSUSE en la herramienta Cavil para el análisis de la limpieza de licencias del código. El modelo publicado abarca 4 mil millones de parámetros y se basa en el modelo Qwen3-4B, optimizado adicionalmente para la clasificación de texto.
La función principal del modelo consiste en identificar las licencias utilizadas en el código fuente de los programas y la documentación. Para realizar esta tarea, el modelo se ha entrenado adicionalmente en un conjunto de datos que incluye 150 mil ejemplos de encabezados y comentarios con menciones de licencias en el código fuente. En la práctica, el modelo permite automatizar la verificación de la limpieza de licencias de la base de código para detectar incompatibilidades de licencias y problemas legales potenciales con el código.
El tamaño del modelo ha sido ajustado para lograr una combinación de comprensión de construcciones lingüísticas de calidad y la capacidad de ejecución en sistemas con GPU de consumo típicas. Además del propio modelo, se ha puesto a disposición un conjunto de datos utilizado durante el entrenamiento y una herramienta para la validación. También hay un procesador disponible para integrar el modelo en la herramienta Cavil, diseñada para verificar el código fuente respecto al cumplimiento de normas y requisitos legales (verificación de licencias, detección de infracciones de licencias, evaluación de riesgos).
Fuente: opennet.ru
