La organización Open Source Initiative (OSI), encargada de verificar licencias de acuerdo con los criterios de Open Source, ha aprobado el documento Open Source AI Definition v1.0 (OSAID), que establece la definición de IA abierta. Un sistema de IA puede considerarse abierto si cumple con los siguientes criterios:
- Posibilidad de uso para cualquier propósito sin necesidad de obtener un permiso adicional;
- Posibilidad de estudiar el funcionamiento del sistema e inspeccionar sus componentes;
- Posibilidad de realizar cambios para cualquier propósito, incluyendo la modificación de la información que el sistema proporciona;
- Posibilidad de transferir a terceros tanto la versión original como las ediciones realizadas tras los cambios, sin restricciones en los fines de uso.
Para permitir los cambios, un sistema de IA abierto debe incluir:
- Información detallada sobre los datos utilizados durante el entrenamiento y la metodología de enseñanza. La información debe ser suficiente para que un desarrollador profesional pueda recrear el sistema de IA equivalente, utilizando los mismos datos o datos similares para el entrenamiento.
- Código fuente que permita tanto ejecutar el sistema de IA como llevar a cabo el proceso de su entrenamiento. El código también debe cubrir áreas como prepocesamiento, verificación de datos y tokenización. Además, debe proporcionarse una descripción detallada de la arquitectura del modelo.
- Parámetros del modelo (coeficientes de peso) que implican la disponibilidad de un corte de estado listo para usar tras el entrenamiento o la existencia de una versión final optimizada del modelo.
Grandes modelos de lenguaje de aprendizaje automático que han sido reconocidos como conformes a los criterios establecidos: Pythia (Eleuther AI), OLMo (AI2), Amber (LLM360), CrystalCoder (LLM360) y T5 (Google).
Grandes modelos de lenguaje de aprendizaje automático que afirman cumplir, pero que requieren modificaciones en las licencias o en las normas de uso: BLOOM (BigScience), Starcoder2 (BigCode) y Falcon (TII).
Grandes modelos de lenguaje de aprendizaje automático que han sido considerados no conformes a los criterios de sistemas de IA abiertos, debido a la falta de componentes necesarios o a la existencia de requisitos incompatibles con los principios de Open Source: Llama2 (Meta), Grok (X/Twitter), Phi-2 (Microsoft) y Mixtral (Mistral).
Fuente: opennet.ru
