Das Unternehmen SUSE hat die große Sprachmodell Cavil-Qwen3-4B unter der Apache 2.0-Lizenz veröffentlicht, die in SUSE- und openSUSE-Projekten im Cavil-Toolkit zur Analyse der Lizenzreinheit von Code eingesetzt wird. Das veröffentlichte Modell umfasst 4 Milliarden Parameter und basiert auf dem Modell Qwen3-4B, das zusätzlich für die Textklassifikation optimiert wurde.
Das Hauptziel des Modells besteht darin, die in den Quellcodes von Programmen und Dokumentationen verwendeten Lizenzen zu bestimmen. Um diese Aufgabe zu erfüllen, wurde das Modell mit einem Datensatz trainiert, der 150.000 Beispiele von Überschriften und Kommentaren mit Erwähnungen von Lizenzen im Quellcode umfasst. In der Praxis ermöglicht das Modell die Automatisierung der Überprüfung der Lizenzreinheit des Codes, um Lizenzinkompatibilitäten und potenzielle rechtliche Probleme mit dem Code zu identifizieren.
Die Modellgröße wurde so gewählt, dass ein Gleichgewicht zwischen dem qualitativ hochwertigen Verständnis von Sprachkonstruktionen und der Leistungsfähigkeit auf Systemen mit gängigen Verbrauchergrafikkarten hergestellt wird. Neben dem Modell ist auch ein Datensatz, der zur Schulung verwendet wurde, sowie ein Toolkit zur Validierung öffentlich zugänglich. Zusätzlich steht ein Handler zur Verfügung, um das Modell im Cavil-Toolkit zu verwenden, das zur Überprüfung des Quellcodes auf die Einhaltung rechtlicher Normen und Anforderungen (Lizenzprüfungen, Feststellung von Lizenzverletzungen, Risikobewertungen) dient.
Quelle: opennet.ru
