Databricks ka hapur modeli i madh gjuhësor DBRX, i cili e tejkalon GPT-3.5 në testime

Kompania Databricks shpalli hapjen e një modeli të madh gjuhësor DBRX, i cili mund të përdoret për të krijuar chatbotë që përgjigjen në pyetje në gjuhën natyrore, zgjidhin detyra matematikore, janë në gjendje të gjenerojnë përmbajtje mbi një temë të caktuar dhe të krijojnë kod në gjuhë të ndryshme programimi. Modeli është zhvilluar nga kompania Mosaic ML, e cila u ble nga Databricks për 1.3 miliard dollarë. Për trajnim u përdor një grumbull prej 3072 GPU NVIDIA H100 Tensor Core. Për përdorimin e modelit të përfunduar rekomandohet 320GB memorie.

GjatĂ« trajnimit tĂ« modelit u pĂ«rdor arkitektura MoE (Mixture of experts), qĂ« lejon marrjen e njĂ« vlerĂ«simi mĂ« tĂ« saktĂ« ekspertizor dhe njĂ« koleksion tekstesh dhe kodi me njĂ« madhĂ«si prej 12 Tb. MadhĂ«sia e kontekstit tĂ« marrĂ« parasysh nga modeli DBRX Ă«shtĂ« 32 mijĂ« tokenĂ« (numri i tokenĂ«ve qĂ« modeli mund tĂ« procesojĂ« dhe tĂ« mbajĂ« mend gjatĂ« gjenerimit tĂ« tekstit). PĂ«r krahasim, madhĂ«sia e kontekstit te modelet Google Gemini dhe OpenAI GPT-4 Ă«shtĂ« 32 mijĂ« tokenĂ«, Google Gemma — 8 mijĂ«, ndĂ«rsa modeli GPT-4 Turbo — 128 mijĂ«.

Modeli mbulon 132 miliard parametra dhe ndahet nĂ« 16 rrjete ekspertĂ«sh, nga tĂ« cilat gjatĂ« procesimit tĂ« kĂ«rkesĂ«s mund tĂ« pĂ«rdoren jo mĂ« shumĂ« se 4 (grupi i parametrave nuk kalon 36 miliard pĂ«r çdo token). PĂ«r krahasim, modeli GPT-4 supozohet tĂ« pĂ«rfshijĂ« 1.76 trilion parametra, modeli Grok (X/Twitter) i hapur kohĂ«t e fundit — 314 miliard, GPT-3.5 — 175 miliard, YaLM (Yandex) — 100 miliard, LLaMA (Meta) — 65 miliard, GigaChat (Sber) — 29 miliard, Gemma (Google) — 7 miliard.

Modeli dhe komponentët e lidhur shpërndahen nën licencën Databricks Open Model License, që lejon përdorimin, riprodhimin, kopjimin, ndryshimin dhe krijimin e produkteve të nxjerra, por me disa kufizime. Për shembull, licenca ndalon përdorimin e DBRX, modeleve të nxjerra dhe çdo produkti të nxjerrë mbi ato për të përmirësuar modele të tjera gjuhësore, përveç DBRX. Licenca gjithashtu ndalon përdorimin e modelit në fusha që shkelin ligjet dhe rregulloret. Modelet e nxjerra duhet të shpërndahen nën të njëjtën licencë. Nëse përdoren në produkte dhe shërbime që përdoren nga më shumë se 700 milion përdorues në muaj, kërkohet një leje e veçantë.

Sipas deklaratës së krijuesve të modelit, në karakteristikat dhe mundësitë e tij, DBRX kalon modelet GPT-3.5 nga kompania OpenAI dhe Grok-1 nga Twitter, dhe mund të konkurrojë me modelin Gemini 1.0 Pro gjatë testimit të nivelit të kuptimit të gjuhës, mundësive për të shkruar kod në gjuhë programimi dhe zgjidhjes së problemeve matematikore. Në disa aplikime, siç është gjenerimi i kërkesave SQL, DBRX arrin në efikasitetin e modelit GPT-4 Turbo, i cili dominos padyshim në treg. Për më tepër, modeli dallohet nga shërbimet konkurrente për shpejtësinë e tij të madhe dhe lejon formimin e përgjigjeve pothuajse menjëherë. Në veçanti, DBRX mund të gjenerojë tekst me një shpejtësi deri në 150 toksina në sekondë për çdo përdorues, që është rreth dy herë më shpejt se modeli LLaMA2-70B.

Databricks ka hapur modeli i madh gjuhësor DBRX, i cili e tejkalon GPT-3.5 në testime
Databricks ka hapur modeli i madh gjuhësor DBRX, i cili e tejkalon GPT-3.5 në testime

Përveç kësaj, mund të theksohet publikimi i përshkrimit teknik të modelit të hapur të gjuhës InternLM2, i cili shpërndahet nën licencën Apache 2.0, i disponueshëm në variante me 20, 7 dhe 1.8 miliard parametra. Modeli zhvillohet nga laboratori i inteligjencës artificiale në Shangai në bashkëpunim me disa universitete kineze dhe është i njohur për konsideratën deri në 200K toksina konteksti dhe mbështetje jo vetëm për anglishten, por edhe për gjuhën kineze. Në shumë teste, modeli është afër GPT-4.

Databricks ka hapur modeli i madh gjuhësor DBRX, i cili e tejkalon GPT-3.5 në testime
Databricks ka hapur modeli i madh gjuhësor DBRX, i cili e tejkalon GPT-3.5 në testime
Databricks ka hapur modeli i madh gjuhësor DBRX, i cili e tejkalon GPT-3.5 në testime

Për më tepër, raportohet për zhvillimin e 84 bërthamave të reja për shumzimin e matricave për mjetin llamafile, i cili zhvillohet nga Mozilla dhe lejon krijimin e skedarëve universale ekzekutues për ekzekutimin e modeleve të mëdha të gjuhës së mësimit të makinerive (LLM). Ndryshimet kanë lejuar përshpejtimin e dukshëm të punës së modeleve në llamafile gjatë ekzekutimit në CPU. Shembuj, ekzekutimi i modeleve me përdorimin e llamafile tani është më i shpejtë se sa me përdorimin e llama.cpp nga 30% deri në 500% në varësi të mjedisit, dhe në krahasim me bibliotekën MKL, operacionet matricore që përputhen në cache L2, në realizimin e ri ekzekutohen dy herë më shpejt.

Burimi: opennet.ru

Blini hosting tĂ« besueshĂ«m pĂ«r faqe interneti me mbrojtje nga DDoS, serverĂ« VPS VDS đŸ”„ Blini hosting tĂ« besueshĂ«m pĂ«r faqe interneti me mbrojtje nga DDoS, serverĂ« VPS VDS | ProHoster