La société Databricks a annoncé le lancement d'un grand modèle linguistique, DBRX, qui peut être utilisé pour créer des chatbots capables de répondre à des questions en langage naturel, de résoudre des problèmes mathématiques proposés, de générer du contenu sur des sujets donnés et de coder dans différents langages de programmation. Le modèle a été développé par Mosaic ML, qui a été acquise par Databricks pour 1,3 milliard de dollars. Un cluster de 3072 GPU NVIDIA H100 Tensor Core a été utilisé pour son entraînement. Pour le déploiement du modèle final, 320 Go de mémoire sont recommandés.
Lors de l'entraînement du modèle, une architecture MoE (Mixture of Experts) a été utilisée pour obtenir une évaluation experte plus précise, ainsi qu'une collection de textes et de codes de 12 To. La taille du contexte pris en compte par le modèle DBRX est de 32 000 jetons (le nombre de jetons que le modèle peut traiter et mémoriser lors de la génération de texte). Pour comparaison, la taille du contexte des modèles Google Gemini et OpenAI GPT-4 est également de 32 000 jetons, tandis que Google Gemma en a 8 000 et que le modèle GPT-4 Turbo en possède 128 000.
Le modèle comprend 132 milliards de paramètres et est divisé en 16 réseaux d'experts, dont au maximum 4 peuvent être utilisés lors du traitement d'une requête (couvrant jusqu'à 36 milliards de paramètres pour chaque jeton). Pour comparaison, le modèle GPT-4 inclurait environ 1,76 trillion de paramètres, le modèle Grok (X/Twitter) récemment dévoilé — 314 milliards, GPT-3.5 — 175 milliards, YaLM (Yandex) — 100 milliards, LLaMA (Meta) — 65 milliards, GigaChat (Sber) — 29 milliards et Gemma (Google) — 7 milliards.
Le modèle et ses composants associés sont distribués sous la licence Databricks Open Model License, qui permet d'utiliser, de reproduire, de copier, de modifier et de créer des produits dérivés, mais avec certaines restrictions. Par exemple, la licence interdit d'utiliser DBRX, les modèles dérivés et toute sortie basée sur eux pour améliorer d'autres modèles de langage, à l'exception de DBRX. La licence interdit également l'utilisation du modèle dans des domaines enfreignant des lois et des règlements. Les modèles dérivés doivent être distribués sous la même licence. Lorsqu'ils sont utilisés dans des produits et services qui comptent plus de 700 millions d'utilisateurs par mois, une autorisation distincte est requise.
Selon les créateurs du modèle, les caractéristiques et les capacités de DBRX surpassent celles des modèles GPT-3.5 de la société OpenAI et Grok-1 de Twitter, et peuvent rivaliser avec le modèle Gemini 1.0 Pro lors des tests de compréhension linguistique, de rédaction de code en langages de programmation et de résolution de problèmes mathématiques. Dans certaines applications, comme la génération de requêtes SQL, DBRX s'approche en efficacité du modèle GPT-4 Turbo, qui est le leader du marché. De plus, le modèle se distingue des services concurrents par sa rapidité d'exécution, permettant de fournir des réponses presque instantanément. En particulier, DBRX peut générer du texte à une vitesse allant jusqu'à 150 jetons par seconde par utilisateur, ce qui est environ deux fois plus rapide que le modèle LLaMA2-70B.


Il convient également de noter la publication de la description technique du grand modèle de langage ouvert InternLM2, qui est distribué sous licence Apache 2.0, disponible en versions avec 20, 7 et 1,8 milliards de paramètres. Le modèle est développé par un laboratoire d'intelligence artificielle à Shanghai, en collaboration avec plusieurs universités chinoises, et se distingue par sa prise en compte de jusqu'à 200K jetons de contexte et par son support non seulement de l'anglais, mais aussi du chinois. Dans de nombreux tests, le modèle se rapproche de GPT-4.



De plus, il est signalé que 84 nouveaux cœurs de multiplication de matrices ont été développés pour l'outil llamafile, en cours de développement par Mozilla et permettant de créer des fichiers exécutables universels pour exécuter de grands modèles de langage d'apprentissage machine (LLM). Les modifications ont permis d'accélérer considérablement le fonctionnement des modèles dans llamafile lorsqu'ils sont exécutés sur CPU. Par exemple, l'exécution des modèles en utilisant llamafile est désormais plus rapide que celle utilisant llama.cpp de 30 % à 500 % selon l'environnement, et en comparaison avec la bibliothèque MKL, les opérations matricielles qui tiennent dans le cache L2 sont exécutées deux fois plus vite dans la nouvelle implémentation.
Source : opennet.ru
