Kompania SUSE njoftoi hapjen, nën licencën Apache 2.0, të një modeli të madh gjuhësor Cavil-Qwen3-4B, i përdorur në projektet SUSE dhe openSUSE në mjetin Cavil për analizimin e pastërtisë licencore të kodit. Modeli i publikuar mbulon 4 miliard parametra dhe bazohet në modelin Qwen3-4B, i optimizuar më tej për klasifikimin e teksteve.
Qëllimi kryesor i modelit është të përcaktojë licencat e përdorura në kodin burimor të programeve dhe dokumentacionit. Për të realizuar këtë detyrë, modeli është trajnuar gjithashtu mbi një grup të dhënash që përfshin 150,000 shembuj titujsh dhe komentesh me përmendje të licencave në kodin burimor. Në praktikë, modeli lejon automatizimin e kontrollit të pastërtisë licencore të bazës së kodit për identifikimin e paanshmërive licencon dhe problemeve ligjore potenciale me kodin.
Madhësia e modelit është përcaktuar për të arritur një kombinim të kuptimit cilësor të strukturave gjuhësore dhe mundësinë e ekzekutimit në sisteme me GPU-të tipike të konsumatorëve. Përveç vetë modelit, në dispozitivi është publikuar një grup të dhënash që është përdorur gjatë trajnimit dhe një mjet për validimin. Gjithashtu, është në dispozitë një procesor për angazhimin e modelit në mjetin Cavil, i destinuar për kontrollin e kodit burimor në lidhje me përputhshmërinë me normat dhe kërkesat ligjore (kontrolli i licencave, identifikimi i shkeljeve të licencave, vlerësimi i rreziqeve).
Burimi: opennet.ru
