El proyecto Debian ha iniciado una votación general sobre los criterios de apertura de modelos de IA

El proyecto Debian ha anunciado la realización de una votación general (GR, resolución general) entre los desarrolladores del proyecto para aprobar los criterios de inclusión de modelos de aprendizaje automático en el repositorio principal del proyecto. En esta etapa, se ha iniciado la fase de discusión, tras la cual comenzará la recolección de votos (la fecha de inicio de la votación aún no se ha determinado). Aproximadamente mil desarrolladores que participan en el mantenimiento de paquetes y la infraestructura de Debian tienen derecho a voto.

Se propone considerar incompatibles con los criterios de Debian, que definen el software libre (DFSG, Debian Free Software Guideline), los modelos de IA distribuidos bajo licencias abiertas, pero sin proporcionar el material fuente y las herramientas para entrenar el modelo. En caso de que la propuesta sea aprobada, tales modelos no podrán ser incluidos en el repositorio principal del proyecto ('main'). La posibilidad de suministrar tales modelos en los repositorios 'non-free' no se contempla en la votación en curso.

Entre los problemas que surgen por la falta de datos utilizados en el entrenamiento, se mencionan:

  • La ausencia de datos originales o programas utilizados para el entrenamiento limita considerablemente las posibilidades de modificar los modelos de IA resultantes. A pesar de que la licencia permite la modificación, en la práctica dicha modificación es complicada. Puede ser necesario cambiar, por ejemplo, el tokenizador, que es necesario para agregar soporte para nuevos idiomas.
  • Los datos utilizados para el entrenamiento pueden considerarse como el 'código fuente' del modelo, y el modelo resultante como el resultado del procesamiento de ese 'código fuente' mediante las herramientas de entrenamiento. Por lo tanto, para una modificación completa del modelo, debe existir la posibilidad de modificar tanto los datos originales como las herramientas.
  • La imposibilidad de reproducir el trabajo realizado para crear el modelo sin acceso a los datos originales y las herramientas.
  • Cuestiones de seguridad y ética. Sin datos fuente y herramientas, la capacidad para abordar vulnerabilidades en los modelos está limitada por la aplicación de parches binarios o la sustitución completa del modelo. Tales parches solo pueden ser preparados por el autor del modelo, y los consumidores del modelo se vuelven completamente dependientes de él. Además, nadie, incluidos los autores del modelo, es capaz de comprender la esencia de los cambios propuestos de esta manera. La falta de datos fuente también dificulta la identificación del reemplazo de puertas traseras en los modelos de aprendizaje automático.
  • Limitaciones en el estudio. Sin datos fuente, es imposible confirmar que el modelo se ha entrenado con datos que se proporcionaron bajo licencias que permiten dicho uso, o excluir que se utilizaron datos obtenidos de forma ilegal durante el entrenamiento. Además, si se utilizaron datos bajo la licencia GPL en el entrenamiento, puede ser necesario analizar la presencia en los resultados producidos por el modelo de fragmentos con una copia de esos datos, para los cuales es necesario mencionar la fuente y la licencia. El desarrollador puede agregar en su proyecto código/contenido generado por el modelo y, sin querer, infringir la licencia de algunos datos fuente.

En octubre del año pasado, la organización OSI (Open Source Initiative) publicó la definición de un sistema de IA abierta (Open Source AI). Un sistema de IA abierta debe ofrecer las siguientes capacidades: uso para cualquier propósito sin necesidad de obtener un permiso separado; estudio del funcionamiento del sistema e inspección de sus componentes; modificación para cualquier propósito; transferencia a otras personas tanto de la versión original como de la versión editada tras modificaciones, sin restricciones en los objetivos de uso. Un sistema de IA abierta debe incluir información detallada sobre la arquitectura del modelo, los datos utilizados durante el entrenamiento y la metodología de entrenamiento, así como el código fuente para ejecutar y entrenar el sistema de IA. La información debe ser suficiente para que un desarrollador profesional pueda recrear por sí mismo un sistema de IA equivalente, utilizando los mismos datos o datos similares para el entrenamiento.

La organización de derechos digitales Software Freedom Conservancy (SFC) ha criticado esta definición. La insatisfacción se debe a que los criterios no incluyen requisitos para proporcionar los datos utilizados para entrenar el modelo. La definición de OSI solo requiere que se proporcione información detallada sobre los datos utilizados en el entrenamiento, pero no los propios datos. La definición aceptada garantiza solo dos de las cuatro libertades proclamadas de Open Source: la posibilidad de usar y la posibilidad de distribuir, mientras que las posibilidades de modificar y estudiar no están completamente garantizadas.

La decisión de OSI se explica porque la publicación de los datos originales en muchos casos es imposible debido a razones ajenas al desarrollador del modelo de IA, como la necesidad de mantener la confidencialidad, el uso de materiales protegidos por derechos de autor, la licencia de datos de proveedores externos, etc. Si se añadiera el requisito de proporcionar datos, ninguno de los modelos de lenguaje a gran escala existentes podría obtener el estatus de abierto, y la propia definición se convertiría en una utopía inalcanzable.

Fuente: opennet.ru

Compra un hosting fiable para sitios web con protección contra DDoS, servidores VPS VDS 🔥 Compra un hosting fiable para sitios web con protección contra DDoS, servidores VPS VDS | ProHoster