Un outil OpenChatKit a été présenté, visant à simplifier la création de chatbots pour des applications spécialisées et générales. Le système est adapté pour exécuter des tâches telles que répondre à des questions, mener des dialogues en plusieurs étapes, résumer, extraire des informations et classifier du texte. Le code est écrit en Python et distribué sous la licence Apache 2.0. Le projet comprend un modèle prêt à l'emploi, du code pour entraîner votre propre modèle, des outils pour tester les résultats du modèle, ainsi que des moyens d'enrichir le modèle avec du contexte provenant d'un index externe et d'adapter le modèle de base pour répondre à des besoins spécifiques.
Comme base du bot, un modèle de machine learning (GPT-NeoXT-Chat-Base-20B) est proposé, construit à l'aide d'un modèle linguistique comportant environ 20 milliards de paramètres et optimisé pour la communication conversationnelle. Pour entraîner le modèle, des données provenant de collections de projets LAION, Together et Ontocord.ai ont été utilisées.
Pour étendre la base de connaissances existante, un système capable d'extraire des informations supplémentaires à partir de dépôts externes, d'API et d'autres sources est proposé. Par exemple, il est possible d'actualiser les informations en utilisant des données de Wikipedia et des flux d'actualités. De plus, un modèle de modération est disponible, entraîné avec 6 milliards de paramètres, basé sur le modèle GPT-JT, et destiné à filtrer les questions inappropriées ou à limiter les discussions dans certaines thématiques.
On peut également mentionner le projet ChatLLaMA, qui propose une bibliothèque pour créer des assistants intelligents similaires à ChatGPT. Le projet se développe en tenant compte de la possibilité d'exécution sur du matériel propre et de la création de solutions personnalisées, destinées à couvrir des domaines de connaissance spécifiques (par exemple, médecine, droit, jeux, recherche scientifique, etc.). Le code de ChatLLaMA est distribué sous la licence GPLv3.
Le projet prend en charge l'utilisation de modèles basés sur l'architecture LLaMA (Large Language Model Meta AI), proposée par Meta. Le modèle complet LLaMA couvre 65 milliards de paramètres, mais pour ChatLLaMA, il est recommandé d'utiliser les versions avec 7 et 13 milliards de paramètres ou les modèles GPTJ (6 milliards), GPTNeoX (1,3 milliards), 20BOPT (13 milliards), BLOOM (7,1 milliards) et Galactica (6,7 milliards). À l'origine, les modèles LLaMA ne sont fournis qu'aux chercheurs sur demande spéciale, mais comme des torrents ont été utilisés pour la livraison des données, des passionnés ont préparé un script permettant à quiconque de télécharger le modèle.
Source : opennet.ru
