L'entreprise SUSE a annoncé le lancement sous licence Apache 2.0 d'un grand modèle linguistique Cavil-Qwen3-4B, utilisé dans les projets SUSE et openSUSE dans l'outil Cavil pour analyser la conformité des licences du code. Le modèle publié couvre 4 milliards de paramètres et est basé sur le modèle Qwen3-4B, optimisé pour la classification des textes.
L'objectif principal du modèle est de définir les licences utilisées dans le code source des programmes et de la documentation. Pour accomplir cette tâche, le modèle a été formé sur un ensemble de données comprenant 150 000 exemples de titres et de commentaires mentionnant des licences dans le code source. En pratique, le modèle permet d'automatiser la vérification de la conformité licentielle de la base de code pour Identifier les incompatibilités de licence et les problèmes juridiques potentiels liés au code.
La taille du modèle est conçue pour atteindre un équilibre entre une compréhension de qualité des constructions linguistiques et la capacité à s'exécuter sur des systèmes avec des GPU standard pour les consommateurs. En plus du modèle lui-même, un ensemble de données utilisé lors de l'apprentissage est également mis à disposition publiquement, ainsi qu'un outil de validation. Un gestionnaire pour intégrer le modèle dans l'outil Cavil, destiné à vérifier que le code source respecte les normes et exigences juridiques (vérification des licences, identification des violations de licences, évaluation des risques), est également disponible.
Source : opennet.ru
