Kompania Databricks shpalli hapjen e modelit të madh gjuhësor DBRX, i cili mund të përdoret për krijimin e chatbot-eve që përgjigjen në pyetje në gjuhën natyrale, zgjidhin probleme matematikore dhe janë në gjendje të gjenerojnë përmbajtje mbi një temë të caktuar dhe të krijojnë kod në disa gjuhë programimi. Modeli është zhvilluar nga kompania Mosaic ML, e cila u ble nga Databricks për 1.3 miliard dollarë. Për trajnimin u përdor një klaster me 3072 GPU NVIDIA H100 Tensor Core. Përnisjen e modelit të gatshëm rekomandohet 320GB memorie.
Gjatë trajnimit të modelit u përdor arkitektura MoE (Mixture of Experts), e cila lejon një vlerësim më të saktë nga ekspertët, dhe një koleksion tekste dhe kodi me një madhësi prej 12 Tb. Madhësia e kontekstit të marrë parasysh nga modeli DBRX është 32 mijë tokene (numri i tokeneve që modeli mund të përpunojë dhe të mbajë mend gjatë gjenerimit të tekstit). Për krahasim, madhësia e kontekstit te modelet Google Gemini dhe OpenAI GPT-4 është 32 mijë tokene, Google Gemma - 8 mijë, ndërsa modeli GPT-4 Turbo - 128 mijë.
Modeli mbulon 132 miliard parametra dhe është e ndarë në 16 rrjete ekspertësh, nga të cilat gjatë përpunimit të një kërkese mund të përdoren jo më shumë se 4 (mbulimi jo më shumë se 36 miliard parametra për çdo token). Për krahasim, modeli GPT-4 supozohet të përmbajë 1.76 trilion parametra, modeli Grok (X/Twitter) i hapur së fundmi - 314 miliard, GPT-3.5 - 175 miliard, YaLM (Yandex) - 100 miliard, LLaMA (Meta) - 65 miliard, GigaChat (Sber) - 29 miliard, Gemma (Google) - 7 miliard.
Modeli dhe komponentët e lidhur shpërndahen nën licencën Databricks Open Model License, që lejon përdorimin, riprodhimin, kopjimin, ndryshimin dhe krijimin e produkteve të dedikuara, por me disa kufizime. Për shembull, licenca ndalon përdorimin e DBRX, modeleve të dedikuara dhe çdo prodhimi në bazë të tyre për përmirësimin e modeleve të tjera gjuhësore, përveç DBRX. Licenca gjithashtu ndalon përdorimin e modelit në fusha që shkelin ligjet dhe rregulloret. Modelet e dedikuara duhet të shpërndahen nën të njëjtën licencë. Kur përdoren në produkte dhe shërbime që përdoren nga më shumë se 700 milion përdorues në muaj, kërkohet marrja e një lejeje të veçantë.
Sipas krijuesve të modelit, karakteristikat dhe mundësitë e DBRX tejkalojnë modelet GPT-3.5 nga kompania OpenAI dhe Grok-1 nga Twitter, dhe mund të konkurrojë me modelin Gemini 1.0 Pro gjatë testeve të nivelit të kuptimit të gjuhës, mundësive të shkruarjes së kodit në gjuhët e programimit dhe zgjidhjen e problemeve matematikore. Në disa aplikime, për shembull, gjatë gjenerimit të pyetjeve SQL, DBRX arrin një efikasitet të ngjashëm me modelin GPT-4 Turbo, i cili dominon në treg. Për më tepër, modeli dallon nga shërbimet konkurruese me një shpejtësi shumë të lartë dhe ndihmon në formimin e përgjigjeve thuajse menjëherë. Në veçanti, DBRX mund të gjenerojë tekst me shpejtësi deri në 150 token në sekondë për çdo përdorues, që është rreth dy herë më shpejt se modeli LLaMA2-70B.


Gjithashtu, vlen të përmendet publikimi i përshkrimit teknik të modelit të madh gjuhësor të hapur InternLM2, i cili shpërndahet nën licencën Apache 2.0, i disponueshëm në variante me 20, 7 dhe 1.8 miliard parametra. Modeli po zhvillohet nga laboratori i inteligjencës artificiale në Shangai me pjesëmarrjen e disa universiteteve kineze dhe është i njohur për mbajtjen e deri në 200K token konteksti dhe mbështetjes jo vetëm të anglishtes, por edhe të gjuhës kineze. Në shumë teste, modeli është afër GPT-4.



Për më tepër, raportohet për zhvillimin e 84 bërthamave të reja për shumimin e matricave për mjetin llamafile, i zhvilluar nga Mozilla dhe që lejon krijimin e skedarëve të ekzekutueshëm universale për ekzekutimin e modeleve të mëdha gjuhësore të mësimit të makinerisë (LLM). Ndryshimet lejuan një shpejtësi shumë më të madhe në punën e modeleve në llamafile gjatë ekzekutimit në CPU. Për shembull, ekzekutimi i modeleve duke përdorur llamafile tani është më i shpejtë, se sa duke përdorur llama.cpp nga 30% deri në 500% varësisht nga ambienti, ndërsa për sa i përket bibliotekës MKL, operacionet matricore që hyjnë në cache L2, në implementimin e ri ekzekutohen dy herë më shpejt.
Burimi: opennet.ru
