Die Organisation Open Source Initiative (OSI), die sich mit der Überprüfung von Lizenzen im Hinblick auf die Kriterien für Open Source beschäftigt, hat das Dokument Open Source AI Definition v1.0 (OSAID) genehmigt, das eine Definition für offene KI formuliert. Ein KI-System kann als offen betrachtet werden, wenn es den folgenden Kriterien entspricht:
- Die Möglichkeit, es für beliebige Zwecke zu nutzen, ohne eine separate Genehmigung einholen zu müssen;
- Die Möglichkeit, die Funktionsweise des Systems zu studieren und seine Komponenten zu inspizieren;
- Die Möglichkeit, Änderungen für beliebige Zwecke vorzunehmen, einschließlich der Änderung der vom System ausgegebenen Informationen;
- Die Möglichkeit, sowohl die unveränderte Version als auch die bearbeitete Version nach Änderungen an Dritte weiterzugeben, ohne Einschränkungen hinsichtlich der Zweckbestimmung der Nutzung.
Um die Möglichkeit zur Vornahme von Änderungen zu bieten, muss ein offenes KI-System Folgendes enthalten:
- Detaillierte Informationen über die für das Training verwendeten Daten und die Methodologie des Trainings. Die Informationen müssen ausreichend sein, damit ein professioneller Entwickler in der Lage ist, ein entsprechendes KI-System mit denselben oder ähnlichen Daten selbst zu rekonstruieren.
- Den Quellcode, der sowohl die Ausführung des KI-Systems als auch den Trainingsprozess ermöglicht. Der Code muss auch Bereiche wie die Vorverarbeitung, die Datenvalidierung und die Tokenisierung abdecken. Darüber hinaus ist eine detaillierte Beschreibung der Modellarchitektur bereitzustellen.
- Die Modelparameter (Gewichtsfaktoren), die darauf hindeuten, dass ein einsatzbereiter Snapshot des Status nach dem Training oder eine finale optimierte Version des Modells vorliegt.
Große Sprachmodelle des maschinellen Lernens, die als konform mit den festgelegten Kriterien anerkannt sind: Pythia (Eleuther AI), OLMo (AI2), Amber (LLM360), CrystalCoder (LLM360) und T5 (Google).
Große Sprachmodelle des maschinellen Lernens, die versuchen, konform zu sein, jedoch Änderungen an Lizenzen oder Nutzungsbedingungen erfordern: BLOOM (BigScience), Starcoder2 (BigCode) und Falcon (TII).
Große Sprachmodelle des maschinellen Lernens, die aufgrund fehlender notwendiger Komponenten oder aufgrund von Anforderungen, die mit den Prinzipien von Open Source unvereinbar sind, nicht als konform mit den Kriterien für offene KI-Systeme anerkannt werden: Llama2 (Meta), Grok (X/Twitter), Phi-2 (Microsoft) und Mixtral (Mistral).
Quelle: opennet.ru
