Проект Debian обяви за провеждане на общо гласуване (GR, обща резолюция) на разработчиците на проекта за утвърждаване на критерии за приемане на модели за машинно обучение в основния репозиторий на проекта. На този етап е започнала фазата на обсъждане, след която ще започне събирането на гласове (датата на началото на гласуването все още не е определена). Право на глас имат около хиляда разработчици, които участват в поддръжката на пакети и инфраструктурата на Debian.
AI моделите, разпространявани под отворени лицензии, но без предоставяне на изходен материал и инструменти за обучение на модела, предлагат да бъдат признати за несъвместими с критериите на Debian, определящи свободното софтуер (DFSG, Ръководство за свободно софтуер на Debian). В случай на одобрение на предложението, подобни модели няма да могат да бъдат включени в основния репозиторий на проекта („main“). Възможността за доставка на такива модели в репозиториите „non-free“ не се разглежда в проведеното гласуване.
Сред проблемите, произлизащи от отсъствието на данни, използвани при обучението, са споменати:
- Отсъствието на изходни данни или програми, използвани за извършване на обучението, значително ограничава възможностите за модификация на готовите AI модели. Въпреки разрешението за модификация в лицензията, на практика подобна модификация е затруднена. Промяна може да се наложи, например, при нуждата от замяна на токенизатора, необходим за добавяне на поддръжка за нови езици.
- Данните, използвани за обучение, могат да се разглеждат като „изходен код“ на модела, а готовият модел като резултат от обработката на този „изходен код“ с инструменти за обучение. Следователно, за пълна модификация на модела трябва да има възможност за модификация на изходните данни и инструментите.
- Невъзможността да се възпроизведе работата, извършена за създаването на модела, без достъп до изходните данни и инструментите.
- Сигурност и етични въпроси. Без изходни данни и инструменти, възможността за отстраняване на уязвимости в моделите е ограничена до прилагане на бинарни пачове или пълна подмяна на модела. Подобни пачове могат да подготвят само авторите на модела, а потребителите на модела стават напълно зависими от тях. При това, никой, включително авторите на модела, не е в състояние да разбере същността на предлаганите по този начин модификации. Липсата на изходни данни също затруднява идентифицирането на вграждането на бекдори в моделите на машинното обучение.
- Ограничения при изучаването. Без изходни данни не е възможно да се потвърди, че моделът е обучен на данни, предоставени под лицензи, допускащи подобно използване, или да се изключи, че при обучението не са били използвани данни, получени по нелегален път. Освен това, ако при обучението са били използвани данни под лиценза GPL, може да е необходимо да се анализира наличието в резултатите на модела на фрагменти, които копират тези данни, за които е необходимо упоменаване на източника и лиценза. Разработчикът може да добави в проекта си генериран от модела код/съдържание и неволно да наруши лиценза на някои изходни данни.
През октомври миналата година организацията OSI (Open Source Initiative) публикува определение за отворена AI-система (Open Source AI). Отворената AI-система трябва да предоставя следните възможности: използване за всякакви цели без необходимост от получаване на отделно разрешение; изучаване на работата на системата и инспектиране на нейните компоненти; внасяне на изменения за всякакви цели; предаване на трети лица както на изходния вариант, така и на редакцията след направените изменения, без ограничения на целите на използване. Отворената AI-система трябва да включва детайлна информация за архитектурата на модела, данните, използвани при обучението, и методологията на обучение, а също и изходния код за стартиране и обучение на AI-системата. Информацията трябва да е достатъчна, за да може професионален разработчик самостоятелно да възпроизведе еквивалентна AI-система, използвайки за обучение същите или подобни данни.
Правозащитната организация Software Freedom Conservancy (SFC) изрази критика към такова определение. Недоволството е продиктувано от факта, че в критериите липсват изисквания за предоставяне на данните, използвани за обучението на модела. В определението на OSI е необходимо само да се предостави подробна информация за данните, използвани при обучението, но не и самите данни. Приетото определение осигурява само две от четирите обявени свободи на Open Source — възможността за използване и възможността за разпространение, като възможностите за модифициране и изучаване не са напълно гарантирани.
Решението на OSI се обяснява с факта, че публикуването на оригиналните данни в много случаи е невъзможно поради причини, независещи от разработчика на AI-модела, като необходимостта от запазване на конфиденциалност, използването на материали, защитени с авторски права, лицензиране на данни от трети страни и т.н. В случай на добавяне на изискване за предоставяне на данни, нито един от съществуващите големи езикови модели не би получил статут на отворен, а самото определение би станало недостижима утопия.
Източник: opennet.ru
