Projekt Debian rozpoczął ogólne głosowanie nad kryteriami otwartości modeli AI.

Projekt Debian ogłosił o przeprowadzeniu ogólnego głosowania (GR, general resolution) wśród programistów projektu w celu zatwierdzenia kryteriów akceptacji modeli uczenia maszynowego do głównego repozytorium projektu. Na tym etapie rozpoczęła się faza dyskusji, po której rozpocznie się zbieranie głosów (data rozpoczęcia głosowania nie została jeszcze określona). Prawo głosu mają około tysiąca programistów, którzy uczestniczą w utrzymaniu pakietów i infrastruktury Debiana.

Modele AI, dystrybuowane na podstawie otwartych licencji, ale bez dostarczania materiału źródłowego i narzędzi do uczenia modelu, proponuje się uznać za niezgodne z kryteriami Debiana, określającymi wolne oprogramowanie (DFSG, Debian Free Software Guideline). W przypadku zatwierdzenia propozycji, takie modele nie będą mogły być dołączane do głównego repozytorium projektu („main”). Możliwość dostarczenia takich modeli w repozytoriach „non-free” w uruchomionym głosowaniu nie jest rozpatrywana.

Wśród problemów, które pojawiają się w przypadku braku danych używanych podczas treningu, wymieniono:

  • Brak danych źródłowych lub programów wykorzystywanych do treningu poważnie ogranicza możliwości modyfikacji gotowych modeli AI. Pomimo zezwolenia na modyfikację w licencji, w praktyce taka modyfikacja jest utrudniona. Zmiany mogą być potrzebne, na przykład, przy konieczności wymiany tokenizatora, niezbędnego do dodania wsparcia dla nowych języków.
  • Dane wykorzystywane do treningu można traktować jako „kod źródłowy” modelu, a gotowy model jako wynik przetwarzania tego „kodu źródłowego” za pomocą narzędzi do treningu. W związku z tym, aby przeprowadzić pełną modyfikację modelu, konieczna jest możliwość modyfikacji danych źródłowych i narzędzi.
  • Nemożność odtworzenia pracy wykonanej w celu stworzenia modelu bez dostępu do danych źródłowych i narzędzi.
  • Bezpieczeństwo i kwestie etyczne. Bez danych źródłowych i narzędzi możliwość eliminacji luk w modelach jest ograniczona poprzez stosowanie binarnych poprawek lub całkowitą wymianę modelu. Takie poprawki może przygotować tylko autor modelu, a użytkownicy modelu stają się całkowicie zależni od niego. Przy tym nikt, w tym autorzy modelu, nie jest w stanie zrozumieć sedna proponowanych w ten sposób zmian. Brak danych źródłowych utrudnia również wykrycie podstawienia backdoorów w modelach uczenia maszynowego.
  • Ograniczenia w nauczaniu. Bez danych źródłowych nie można potwierdzić, że model został wyuczony na danych dostarczanych na podstawie licencji, które dopuszczają takie wykorzystanie, ani wykluczyć, że podczas nauki nie użyto danych uzyskanych w sposób nielegalny. Ponadto, jeśli podczas nauki wykorzystano dane na licencji GPL, może być konieczna analiza obecności w wyniku wydanym przez model fragmentów z kopią tych danych, dla których wymagane jest podanie źródła i licencji. Deweloper może przypadkowo naruszyć licencję na niektóre dane źródłowe, dodając do swojego projektu kod/content generowany przez model.

W październiku ubiegłego roku organizacja OSI (Open Source Initiative) opublikowała definicję otwartego systemu AI (Open Source AI). Otwarty system AI powinien zapewniać następujące możliwości: użycie w dowolnym celu bez konieczności uzyskania osobnego pozwolenia; badanie działania systemu i inspekcję jego komponentów; wprowadzanie zmian w dowolnych celach; przekazywanie innym osobom zarówno oryginału, jak i edycji po wprowadzeniu zmian, bez ograniczeń celów użycia. Otwarty system AI powinien zawierać szczegółowe informacje o architekturze modelu, danych użytych podczas nauki i metodologii nauczania, a także kod źródłowy do uruchomienia i nauki systemu AI. Informacji powinno być wystarczająco dużo, aby profesjonalny deweloper mógł samodzielnie odtworzyć równoważny system AI, używając do nauki tych samych lub podobnych danych.

Organizacja broniąca praw Software Freedom Conservancy (SFC) skrytykowała takie definicje. Niezadowolenie wynika z tego, że w kryteriach brakuje wymogu dostarczenia danych użytych do szkolenia modelu. W definicji OSI wymagane jest jedynie podanie szczegółowych informacji o danych użytych w procesie szkolenia, ale nie samych danych. Przyjęta definicja gwarantuje jedynie dwie z czterech deklarowanych swobód Open Source — możliwość używania oraz możliwość dystrybucji, podczas gdy możliwości modyfikacji i analizy nie są zapewnione w pełni.

Decyzja OSI tłumaczy się tym, że publikacja danych źródłowych w wielu przypadkach jest niemożliwa z powodów niezależnych od twórcy modelu AI, takich jak konieczność zachowania prywatności, wykorzystanie materiałów chronionych prawem autorskim, licencjonowanie danych od zewnętrznych dostawców itd. W przypadku dodania wymogu dotyczącego dostarczania danych żadna z istniejących dużych modeli językowych nie uzyskałaby statusu otwartego, a sama definicja stałaby się nieosiągalną utopią.

Źródło: opennet.ru

Kup solidny hosting stron z ochroną przed DDoS, serwery VPS VDS 🔥 Kup solidny hosting stron z ochroną przed DDoS, serwery VPS VDS | ProHoster