Databricks a lansat un model lingvistic mare DBRX, care depășește GPT-3.5 în teste

Compania Databricks a anunțat lansarea unui model lingvistic mare, DBRX, care poate fi utilizat pentru a crea chatboti capabili să răspundă la întrebări în limbaj natural, să rezolve probleme matematice propuse, să genereze conținut pe o temă dată și să scrie cod în diverse limbaje de programare. Modelul a fost dezvoltat de compania Mosaic ML, care a fost achiziționată de Databricks pentru 1,3 miliarde de dolari. Pentru antrenament, a fost utilizat un cluster format din 3072 GPU NVIDIA H100 Tensor Core. Pentru a rula modelul final, se recomandă 320 GB de memorie.

În timpul antrenamentului, modelul a utilizat arhitectura MoE (Mixture of Experts), care permite obținerea unei evaluări mai precise din partea experților, precum și o colecție de texte și coduri, având o dimensiune de 12 TB. Dimensiunea contextului pe care modelul DBRX îl consideră este de 32 de mii de tokeni (numărul de tokeni pe care modelul îi poate procesa și reține în timpul generării textului). Spre comparație, dimensiunea contextului pentru modelele Google Gemini și OpenAI GPT-4 este de 32 de mii de tokeni, Google Gemma — 8 mii, iar pentru modelul GPT-4 Turbo — 128 de mii.

Modelul acoperă 132 de miliarde de parametrii și este împărțit în 16 rețele de experți, dintre care pot fi utilizate, în timpul procesării unei solicitări, nu mai mult de 4 (acoperind nu mai mult de 36 de miliarde de parametrii pentru fiecare token). Spre comparație, modelul GPT-4 include, probabil, 1,76 trilioane de parametrii, modelul Grok (X/Twitter), recent anunțat, are 314 miliarde, GPT-3.5 — 175 miliarde, YaLM (Yandex) — 100 miliarde, LLaMA (Meta) — 65 miliarde, GigaChat (Sber) — 29 miliarde, iar Gemma (Google) — 7 miliarde.

Modelul și componentele asociate sunt distribuite sub licența Databricks Open Model License, care permite utilizarea, reproducerea, copierea, modificarea și crearea de produse derivate, dar cu anumite restricții. De exemplu, licența interzice utilizarea DBRX, a modelelor derivate și a oricărei ieșiri bazate pe acestea pentru îmbunătățirea altor modele lingvistice, diferite de DBRX. Licența interzice, de asemenea, utilizarea modelului în domenii care încalcă legile și reglementările. Modelele derivate trebuie distribuite sub aceeași licență. În cazul utilizării în produse și servicii accesate de mai mult de 700 de milioane de utilizatori pe lună, este necesară obținerea unei permisiuni separate.

Conform afirmațiilor creatorilor modelului, DBRX depășește din punct de vedere al caracteristicilor și capacităților modelele GPT-3.5 de la OpenAI și Grok-1 de la Twitter, putând concura cu modelul Gemini 1.0 Pro în testele de înțelegere a limbajului, abilitățile de programare și rezolvarea problemelor matematice. În anumite aplicații, cum ar fi generarea de interogări SQL, DBRX se apropie de eficiența modelului GPT-4 Turbo, care conduce pe piață. În plus, modelul se distinge de serviciile concurente prin rapiditatea de lucru, permițând generarea răspunsului aproape instantaneu. În special, DBRX poate genera text cu o viteză de până la 150 de tokeni pe secundă pentru un singur utilizator, ceea ce este aproximativ de două ori mai repede decât modelul LLaMA2-70B.

Databricks a lansat un model lingvistic mare DBRX, care depășește GPT-3.5 în teste
Databricks a lansat un model lingvistic mare DBRX, care depășește GPT-3.5 în teste

De asemenea, merită menționată publicarea descrierii tehnice a modelului de limbaj mare open-source InternLM2, care este distribuit sub licența Apache 2.0, disponibil în variante cu 20, 7 și 1,8 miliarde de parametrii. Modelul este dezvoltat de laboratorul de inteligență artificială din Shanghai, cu participarea mai multor universități chineze, și se remarcă prin capacitatea de a gestiona până la 200K tokeni de context și sprijin pentru nu doar limba engleză, ci și pentru limba chineză. În multe teste, modelul se apropie de GPT-4.

Databricks a lansat un model lingvistic mare DBRX, care depășește GPT-3.5 în teste
Databricks a lansat un model lingvistic mare DBRX, care depășește GPT-3.5 în teste
Databricks a lansat un model lingvistic mare DBRX, care depășește GPT-3.5 în teste

În plus, se raportează despre dezvoltarea a 84 de noi nuclee pentru înmulțirea matricelor pentru instrumentul llamafile, dezvoltat de Mozilla, care permite crearea de fișiere executabile universale pentru rularea modelelor mari de limbaj de învățare automată (LLM). Modificările au permis accelerarea semnificativă a funcționării modelelor în llamafile atunci când sunt executate pe CPU. De exemplu, rularea modelelor folosind llamafile este acum mai rapidă cu între 30% și 500% comparativ cu folosirea llama.cpp, în funcție de mediu, iar comparativ cu biblioteca MKL, operațiile matriciale care se încadrează în cache-ul L2 sunt executate acum de două ori mai repede în noua implementare.

Sursa: opennet.ro

Cumpără un hosting fiabil pentru site-uri cu protecție DDoS, servere VPS VDS 🔥 Cumpără un hosting fiabil pentru site-uri cu protecție DDoS, servere VPS VDS | ProHoster