Projekt Debian rozpoczęło się głosowanie ogólne nad kryteriami otwartości modeli AI

Projekt Debian ogłosiło głosowanie nad uchwałą ogólną (GR) wśród deweloperów projektu w celu zatwierdzenia kryteriów akceptacji modeli uczenia maszynowego w głównym repozytorium projektu. Rozpoczęła się faza dyskusji, po której rozpocznie się zbieranie głosów (data rozpoczęcia głosowania nie została jeszcze ustalona). Uprawnionych do głosowania jest około 1000 deweloperów zaangażowanych w utrzymanie pakietów i infrastruktury. Debian.

Modele sztucznej inteligencji rozpowszechniane na otwartych licencjach, ale bez dostarczenia materiałów źródłowych i narzędzi do trenowania modelu, proponuje się uznać za niezgodne z kryteriami Debiandefiniując wolne oprogramowanie (DFSG, Debian (Wytyczne dotyczące wolnego oprogramowania). Jeśli wniosek zostanie zatwierdzony, takie modele nie będą mogły zostać uwzględnione w głównym repozytorium projektu. Możliwość przesyłania takich modeli do repozytoriów, które nie są wolne, nie jest brana pod uwagę w obecnym procesie głosowania.

Do problemów, które mogą wystąpić, gdy nie ma dostępnych danych do szkolenia, zalicza się m.in.:

  • Brak danych źródłowych lub programów służących do szkolenia znacznie ogranicza możliwość modyfikowania gotowych modeli sztucznej inteligencji. Mimo że licencja dopuszcza taką modyfikację, w praktyce jest ona trudna do przeprowadzenia. Zmiana może być konieczna na przykład wtedy, gdy tokenizer musi zostać wymieniony, aby zapewnić obsługę nowych języków.
  • Dane wykorzystane do treningu można interpretować jako „kod źródłowy” modelu, a gotowy model jako wynik przetworzenia tego „kodu źródłowego” przez narzędzie treningowe. Zatem, aby model był w pełni zmodyfikowany, musi istnieć możliwość modyfikacji danych początkowych i narzędzi.
  • Bez dostępu do oryginalnych danych i narzędzi nie da się odtworzyć pracy wykonanej w celu stworzenia modelu.
  • Kwestie bezpieczeństwa i etyki. Bez danych źródłowych i narzędzi możliwość naprawy luk w modelach ogranicza się do stosowania poprawek binarnych lub całkowitej wymiany modelu. Tylko autor modelu może przygotować takie poprawki, a odbiorcy modelu stają się od niego całkowicie zależni. Jednocześnie nikt, łącznie z autorami modelu, nie jest w stanie zrozumieć istoty proponowanych w ten sposób zmian. Brak danych źródłowych utrudnia również wykrywanie wtrąceń do modeli uczenia maszynowego.
  • Ograniczenia badania. Bez oryginalnych danych nie można potwierdzić, że model został wytrenowany na danych dostarczonych na podstawie licencji zezwalających na takie wykorzystanie, ani wykluczyć, że w treningu nie wykorzystano danych uzyskanych nielegalnie. Ponadto, jeśli podczas treningu wykorzystano dane objęte licencją GPL, konieczne może okazać się przeanalizowanie, czy dane wyjściowe modelu zawierają fragmenty zawierające kopię tych danych, wymagające odwołania się do źródła i licencji. Programista może dodać do swojego projektu kod/treść wygenerowaną na podstawie modelu i nieświadomie naruszyć licencję w odniesieniu do niektórych danych źródłowych.

W październiku ubiegłego roku Open Source Initiative (OSI) opublikowało definicję systemu sztucznej inteligencji o otwartym kodzie źródłowym. Otwarty system sztucznej inteligencji powinien zapewniać następujące możliwości: możliwość wykorzystania w dowolnym celu bez konieczności uzyskania osobnego pozwolenia; badanie działania systemu i kontrola jego podzespołów; wprowadzanie zmian w jakimkolwiek celu; przekazać innym osobom zarówno wersję oryginalną, jak i wersję poprawioną po wprowadzeniu zmian, bez ograniczania celów wykorzystania. Otwarty system AI musi zawierać szczegółowe informacje o architekturze modelu, danych użytych do szkolenia i metodologii szkolenia, a także kod źródłowy służący do uruchamiania i szkolenia systemu AI. Informacje te powinny być wystarczające, aby profesjonalny programista mógł samodzielnie odtworzyć równoważny system AI, wykorzystując do szkolenia te same lub podobne dane.

Organizacja Software Freedom Conservancy (SFC) skrytykowała tę definicję. Niezadowolenie wynika z faktu, że kryteria nie wymagają dostarczenia danych służących do trenowania modelu. Definicja OSI wymaga podania wyłącznie szczegółów danych treningowych, a nie samych danych treningowych. Przyjęta definicja gwarantuje tylko dwie z czterech wolności Open Source – prawo do korzystania i prawo do rozpowszechniania, podczas gdy prawa do modyfikowania i badania nie są w pełni zagwarantowane.

Decyzja OSI jest uzasadniona faktem, że publikacja oryginalnych danych jest w wielu przypadkach niemożliwa z przyczyn niezależnych od twórcy modelu AI, takich jak konieczność zachowania poufności, wykorzystanie materiałów chronionych prawem autorskim, licencjonowanie danych od zewnętrznych dostawców itp. Gdyby dodano wymóg dostarczania danych, żaden z istniejących dużych modeli językowych nie byłby uważany za otwarty, a sama definicja stałaby się nieosiągalną utopią.

Źródło: opennet.ru

Kup niezawodny hosting dla stron z ochroną DDoS, serwery VPS VDS 🔥 Kup niezawodny hosting stron internetowych z ochroną DDoS, serwery VPS VDS | ProHoster