Firma SUSE ogłosiła otwarcie dużego modelu językowego Cavil-Qwen3-4B na licencji Apache 2.0, stosowanego w projektach SUSE i openSUSE w narzędziu Cavil do analizy zgodności licencyjnej kodu. Opublikowany model obejmuje 4 miliardy parametrów i jest oparty na modelu Qwen3-4B, dodatkowo zoptymalizowanym do klasyfikacji tekstu.
Głównym celem modelu jest określenie licencji stosowanych w kodzie źródłowym oprogramowania oraz dokumentacji. Aby wykonać to zadanie, model został dodatkowo przeszkolony na zbiorze danych zawierającym 150 tysięcy przykładów nagłówków i komentarzy z odniesieniami do licencji w kodzie źródłowym. W praktyce model automatyzuje sprawdzanie zgodności licencyjnej bazy kodu w celu wykrywania niezgodności licencyjnych i potencjalnych problemów prawnych związanych z kodem.
Rozmiar modelu został dobrany w celu osiągnięcia połączenia jakościowego rozumienia konstrukcji językowych i możliwości uruchamiania na systemach z typowymi konsumpcyjnymi GPU. Oprócz samego modelu w wolnym dostępie znajduje się zbiór danych użyty podczas szkolenia oraz narzędzie do walidacji. Dostępny jest także procesor do wykorzystania modelu w narzędziu Cavil, przeznaczonym do sprawdzania kodu źródłowego pod kątem zgodności z przepisami prawnymi i wymaganiami (sprawdzanie licencji, wykrywanie naruszeń licencji, ocena ryzyka).
Źródło: opennet.ru
