Databricks hat ein großes Sprachmodell DBRX veröffentlicht, das in Tests GPT-3.5 übertrifft.

Das Unternehmen Databricks hat ein großes Sprachmodell namens DBRX vorgestellt, das zur Erstellung von Chatbots verwendet werden kann, die Fragen in natürlicher Sprache beantworten, mathematische Probleme lösen, Inhalte zu bestimmten Themen generieren und Codes in verschiedenen Programmiersprachen erstellen können. Das Modell wurde von Mosaic ML entwickelt, das von Databricks für 1,3 Milliarden Dollar gekauft wurde. Zum Training wurde ein Cluster aus 3072 NVIDIA H100 Tensor Core GPUs verwendet. Für den Betrieb des fertiggestellten Modells wird 320 GB RAM empfohlen.

Beim Training des Modells kam die MoE-Architektur (Mixture of Experts) zum Einsatz, die eine genauere Expertenbewertung ermöglicht, sowie eine Sammlung von Texten und Codes mit einer Größe von 12 TB. Der Kontext, den das Modell DBRX berücksichtigt, beträgt 32.000 Tokens (die Anzahl der Tokens, die das Modell bei der Textgenerierung verarbeiten und merken kann). Zum Vergleich: Der Kontext für die Modelle Google Gemini und OpenAI GPT-4 beträgt ebenfalls 32.000 Tokens, Google Gemma – 8.000 und das Modell GPT-4 Turbo – 128.000.

Das Modell umfasst 132 Milliarden Parameter und ist in 16 Expertennetzwerke unterteilt, von denen bei der Verarbeitung einer Anfrage maximal 4 verwendet werden können (Maximal 36 Milliarden Parameter pro Token). Zum Vergleich: Das Modell GPT-4 soll etwa 1,76 Billionen Parameter umfassen, das kürzlich vorgestellte Grok-Modell von X/Twitter – 314 Milliarden, GPT-3.5 – 175 Milliarden, YaLM (Yandex) – 100 Milliarden, LLaMA (Meta) – 65 Milliarden, GigaChat (Sber) – 29 Milliarden und Gemma (Google) – 7 Milliarden.

Das Modell und die zugehörigen Komponenten werden unter der Databricks Open Model License lizenziert, die die Nutzung, Vervielfältigung, Kopie, Modifikation und Erstellung abgeleiteter Produkte erlaubt, jedoch mit bestimmten Einschränkungen. Beispielsweise verbietet die Lizenz die Nutzung von DBRX, abgeleiteten Modellen und allen Ausgaben auf deren Basis zur Verbesserung anderer Sprachmodelle, die nicht DBRX sind. Die Lizenz verbietet auch die Nutzung des Modells in Bereichen, die gegen Gesetze und Vorschriften verstoßen. Abgeleitete Modelle müssen unter derselben Lizenz veröffentlicht werden. Bei der Verwendung in Produkten und Diensten, die von mehr als 700 Millionen Nutzern pro Monat verwendet werden, ist eine separate Genehmigung erforderlich.

Laut den Entwicklern übertrifft das Modell DBRX in Bezug auf seine Eigenschaften und Fähigkeiten die Modelle GPT-3.5 von OpenAI und Grok-1 von Twitter und kann im Test des Sprachverständnisses, der Programmierfähigkeiten sowie der Lösung mathematischer Aufgaben mit dem Modell Gemini 1.0 Pro konkurrieren. In einigen Anwendungen, wie beispielsweise bei der Generierung von SQL-Abfragen, erreicht DBRX in Bezug auf die Effizienz annähernd die Leistung des Modells GPT-4 Turbo, das führend auf dem Markt ist. Darüber hinaus zeichnet sich das Modell durch eine sehr schnelle Verarbeitung aus und ermöglicht nahezu sofortige Antworten. Insbesondere kann DBRX Texte mit einer Geschwindigkeit von bis zu 150 Token pro Sekunde für einen Benutzer generieren, was ungefähr doppelt so schnell ist wie das Modell LLaMA2-70B.

Databricks hat ein großes Sprachmodell DBRX veröffentlicht, das in Tests GPT-3.5 übertrifft.
Databricks hat ein großes Sprachmodell DBRX veröffentlicht, das in Tests GPT-3.5 übertrifft.

Zusätzlich sollte die Veröffentlichung der technischen Beschreibung des offenen großen Sprachmodells InternLM2 erwähnt werden, das unter der Lizenz Apache 2.0 verbreitet wird und in Varianten mit 20, 7 und 1,8 Milliarden Parametern verfügbar ist. Das Modell wird von einem KI-Labor in Shanghai mit der Beteiligung mehrerer chinesischer Universitäten entwickelt und zeichnet sich durch die Berücksichtigung von bis zu 200K Kontext-Token aus sowie durch die Unterstützung nicht nur der englischen, sondern auch der chinesischen Sprache. In vielen Tests ist das Modell nah an GPT-4.

Databricks hat ein großes Sprachmodell DBRX veröffentlicht, das in Tests GPT-3.5 übertrifft.
Databricks hat ein großes Sprachmodell DBRX veröffentlicht, das in Tests GPT-3.5 übertrifft.
Databricks hat ein großes Sprachmodell DBRX veröffentlicht, das in Tests GPT-3.5 übertrifft.

Darüber hinaus wird von der Entwicklung von 84 neuen Matrizen-Multiplikationskernen für das Tool llamafile berichtet, das von Mozilla entwickelt wird und die Erstellung universeller ausführbarer Dateien ermöglicht, um große Sprachmodelle für maschinelles Lernen (LLM) auszuführen. Die Änderungen haben die Ausführung der Modelle in llamafile auf CPU erheblich beschleunigt. Zum Beispiel ist die Ausführung von Modellen bei Verwendung von llamafile jetzt 30 % bis 500 % schneller als bei Verwendung von llama.cpp, abhängig von der Umgebung, und im Vergleich zur MKL-Bibliothek werden Matrizenoperationen, die im L2-Cache Platz finden, in der neuen Implementierung doppelt so schnell ausgeführt.

Quelle: opennet.ru

60GB SSD 8Gb DDR4