Databricks ha lanciato un grande modello linguistico DBRX, che supera nei test GPT-3.5

L'azienda Databricks ha annunciato il lancio del grande modello linguistico DBRX, che può essere utilizzato per creare chatbot in grado di rispondere a domande in linguaggio naturale, risolvere problemi matematici proposti, generare contenuti su argomenti specifici e scrivere codice in vari linguaggi di programmazione. Il modello è stato sviluppato dall'azienda Mosaic ML, acquisita da Databricks per 1,3 miliardi di dollari. Per l'addestramento è stato utilizzato un cluster di 3072 GPU NVIDIA H100 Tensor Core. Per l'esecuzione del modello finale si raccomandano 320 GB di memoria.

Durante l'addestramento del modello è stata utilizzata l'architettura MoE (Mixture of Experts), che consente di ottenere valutazioni esperte più accurate, e una collezione di testi e codice di dimensioni pari a 12 TB. La dimensione del contesto considerata dal modello DBRX è di 32.000 token (il numero di token che il modello può elaborare e memorizzare durante la generazione di testo). A titolo di confronto, la dimensione del contesto dei modelli Google Gemini e OpenAI GPT-4 è di 32.000 token, Google Gemma è di 8.000, e il modello GPT-4 Turbo è di 128.000.

Il modello copre 132 miliardi di parametri ed è suddiviso in 16 reti esperte, delle quali possono essere utilizzate non più di 4 durante l'elaborazione della richiesta (con una copertura di non più di 36 miliardi di parametri per ogni token). A titolo di confronto, il modello GPT-4 include presumibilmente 1,76 trilioni di parametri, il recente modello Grok di X/Twitter — 314 miliardi, GPT-3.5 — 175 miliardi, YaLM (Yandex) — 100 miliardi, LLaMA (Meta) — 65 miliardi, GigaChat (Sber) — 29 miliardi, Gemma (Google) — 7 miliardi.

Il modello e i relativi componenti sono distribuiti sotto la licenza Databricks Open Model License, che consente l'utilizzo, la riproduzione, la copia, la modifica e la creazione di prodotti derivati, ma con alcune restrizioni. Ad esempio, la licenza proibisce di utilizzare DBRX, i modelli derivati e qualsiasi output basato su di essi per migliorare altri modelli linguistici diversi da DBRX. La licenza vieta inoltre l'uso del modello in aree che violano le leggi e i regolamenti. I modelli derivati devono essere distribuiti sotto la stessa licenza. Nel caso di utilizzo in prodotti e servizi utilizzati da oltre 700 milioni di utenti al mese, è necessario ottenere un'autorizzazione separata.

Secondo quanto dichiarato dagli sviluppatori del modello, per le sue caratteristiche e capacità, DBRX supera i modelli GPT-3.5 di OpenAI e Grok-1 di Twitter, e può competere con il modello Gemini 1.0 Pro nei test di comprensione del linguaggio, capacità di scrivere codice nei linguaggi di programmazione e risoluzione di problemi matematici. In alcune applicazioni, ad esempio nella generazione di query SQL, DBRX si avvicina all'efficienza del modello GPT-4 Turbo, che è leader nel mercato. Inoltre, il modello si distingue dai servizi concorrenti per la sua rapidità, permettendo di generare risposte quasi istantaneamente. In particolare, DBRX può generare testo a una velocità di fino a 150 token al secondo per singolo utente, circa due volte più veloce del modello LLaMA2-70B.

Databricks ha lanciato un grande modello linguistico DBRX, che supera nei test GPT-3.5
Databricks ha lanciato un grande modello linguistico DBRX, che supera nei test GPT-3.5

In aggiunta, va segnalata la pubblicazione di una descrizione tecnica del modello linguistico open source InternLM2, che viene distribuito sotto licenza Apache 2.0, disponibile nelle varianti con 20, 7 e 1,8 miliardi di parametri. Il modello è sviluppato da un laboratorio di intelligenza artificiale di Shanghai con il contributo di diverse università cinesi e si distingue per la capacità di gestire fino a 200K token di contesto e per il supporto non solo della lingua inglese, ma anche di quella cinese. In molti test, il modello si avvicina a GPT-4.

Databricks ha lanciato un grande modello linguistico DBRX, che supera nei test GPT-3.5
Databricks ha lanciato un grande modello linguistico DBRX, che supera nei test GPT-3.5
Databricks ha lanciato un grande modello linguistico DBRX, che supera nei test GPT-3.5

Inoltre, si segnala lo sviluppo di 84 nuovi core per la moltiplicazione di matrici per l'toolset llamafile, sviluppato da Mozilla, che consente di creare eseguibili universali per l'esecuzione di modelli linguistici di apprendimento automatico (LLM). Le modifiche hanno permesso di accelerare significativamente il funzionamento dei modelli su llamafile quando eseguiti su CPU. Ad esempio, l'esecuzione di modelli utilizzando llamafile è ora più veloce rispetto a llama.cpp da 30% a 500% a seconda dell'ambiente, e rispetto alla libreria MKL le operazioni matriciali che rientrano nella cache L2 vengono eseguite due volte più velocemente nella nuova implementazione.

Fonte: opennet.ru

Acquista hosting affidabile per siti web con protezione DDoS, VPS VDS server 🔥 Acquista hosting affidabile per siti web con protezione DDoS, VPS VDS server | ProHoster