Se ha presentado un conjunto de herramientas abierto, OpenChatKit, diseñado para simplificar la creación de chatbots tanto para aplicaciones especializadas como generales. El sistema se adapta para realizar tareas como responder preguntas, mantener diálogos multietapa, resumir, extraer información y clasificar texto. El código está escrito en Python y se distribuye bajo la licencia Apache 2.0. El proyecto incluye un modelo listo para usar, código para entrenar su propio modelo, utilidades para probar los resultados del modelo, herramientas para complementar el modelo con contexto de un índice externo y adaptar el modelo base para resolver tareas propias.
Como base del bot se propone un modelo de aprendizaje automático básico (GPT-NeoXT-Chat-Base-20B), desarrollado con un modelo de lenguaje que abarca aproximadamente 20 mil millones de parámetros y optimizado para la comunicación conversacional. Para entrenar el modelo se utilizaron datos obtenidos de colecciones de los proyectos LAION, Together y Ontocord.ai.
Para ampliar la base de conocimiento existente, se propone un sistema capaz de extraer información adicional de repositorios externos, API y otras fuentes. Por ejemplo, es posible actualizar información utilizando datos de Wikipedia y feeds de noticias. Además, está disponible un modelo para moderación, entrenado con 6 mil millones de parámetros, basado en el modelo GPT-JT y diseñado para filtrar preguntas inapropiadas o restringir discusiones en torno a ciertos temas.
Cabe destacar el proyecto ChatLLaMA, que ofrece una biblioteca para crear asistentes inteligentes similares a ChatGPT. El proyecto se está desarrollando con la posibilidad de ejecutarse en hardware propio y de crear soluciones personalizadas enfocadas en áreas específicas del conocimiento (por ejemplo, medicina, jurisprudencia, juegos, investigaciones científicas, etc.). El código de ChatLLaMA se distribuye bajo la licencia GPLv3.
El proyecto admite el uso de modelos basados en la arquitectura LLaMA (Large Language Model Meta AI), propuesta por Meta. El modelo completo de LLaMA cubre 65 mil millones de parámetros, pero se recomienda utilizar versiones con 7 y 13 mil millones de parámetros para ChatLLaMA o modelos GPTJ (6 mil millones), GPTNeoX (1.3 mil millones), 20BOPT (13 mil millones), BLOOM (7.1 mil millones) y Galactica (6.7 mil millones). Inicialmente, los modelos LLaMA se suministran solo a investigadores mediante solicitud especial, pero como se utilizaron torrents para la entrega de datos, los entusiastas prepararon un script que permite descargar el modelo a cualquiera que lo desee.
Fuente: opennet.ru
