Firma Databricks poinformowała o odkryciu dużego modelu językowego DBRX, który można wykorzystać do tworzenia chatbotów potrafiących odpowiadać na pytania w języku naturalnym, rozwiązywać problemy matematyczne, generować treści na zadany temat i pisać kod w różnych językach programowania. Model został opracowany przez firmę Mosaic ML, którą Databricks kupił za 1.3 miliarda dolarów. Do szkolenia wykorzystano klaster 3072 procesorów graficznych NVIDIA H100 Tensor Core. Do uruchomienia gotowego modelu zalecane jest posiadanie 320 GB pamięci.
Do trenowania modelu wykorzystano architekturę MoE (Mixture of experts), która pozwala na dokładniejszą ocenę ekspertów, oraz zbiór tekstów i kodu o rozmiarze 12 TB. Rozmiar kontekstu brany pod uwagę przez model DBRX wynosi 32 tysiące tokenów (liczba tokenów, którą model może przetworzyć i zapamiętać podczas generowania tekstu). Dla porównania, rozmiar kontekstu dla modeli Google Gemini i OpenAI GPT-4 wynosi 32 tysiące tokenów, Google Gemma – 8 tysięcy, a modelu GPT-4 Turbo – 128 tysięcy.
Model obejmuje 132 miliardy parametrów i jest podzielony na 16 sieci eksperckich, z których nie więcej niż 4 można wykorzystać podczas przetwarzania żądania (obejmując nie więcej niż 36 miliardów parametrów dla każdego tokena). Dla porównania, model GPT-4 rzekomo obejmuje 1.76 biliona parametrów, niedawno odkryty model X/Twitter Grok (X/Twitter) – 314 miliardów, GPT-3.5 – 175 miliardów, YaLM (Yandex) – 100 miliardów, LLaMA (Meta) – 65 miliardów, GigaChat (Sber) – 29 miliardów, Gemma (Google) – 7 miliardów.
Model i powiązane z nim komponenty są licencjonowane na podstawie licencji Databricks Open Model License, która zezwala na ich użytkowanie, reprodukcję, kopiowanie, modyfikowanie i tworzenie prac pochodnych, jednak z pewnymi ograniczeniami. Na przykład licencja zabrania używania DBRX, jego modeli pochodnych i jakichkolwiek wyników opartych na nich w celu rozszerzenia modeli językowych innych niż DBRX. Licencja zabrania również korzystania z modelu w miejscach, w których naruszane są przepisy prawa. Modele pochodne muszą być rozpowszechniane na tej samej licencji. W przypadku produktów i usług, z których korzysta ponad 700 milionów użytkowników miesięcznie, wymagane jest osobne zezwolenie.
Według twórców modelu, pod względem cech i możliwości, DBRX przewyższa modele GPT-3.5 firmy OpenAI i Grok-1 firmy Twitter, a w testach poziomu rozumienia języka, umiejętności pisania kodu w językach programowania i rozwiązywania problemów matematycznych może konkurować z modelem Gemini 1.0 Pro. W niektórych zastosowaniach, takich jak generowanie zapytań SQL, wydajność DBRX zbliża się do wiodącego na rynku modelu GPT-4 Turbo. Ponadto model ten różni się od konkurencyjnych usług tym, że działa bardzo szybko i umożliwia niemal natychmiastowe wygenerowanie odpowiedzi. W szczególności DBRX może generować tekst z szybkością do 150 tokenów na sekundę na użytkownika, co jest szybkością około dwukrotnie większą niż w przypadku modelu LLaMA2-70B.


Dodatkowo warto odnotować opublikowanie opisu technicznego otwartego modelu językowego InternLM2, który jest dystrybuowany na licencji Apache 2.0 i dostępny w wersjach z 20, 7 i 1.8 miliarda parametrów. Model ten jest rozwijany przez Szanghajskie Laboratorium Sztucznej Inteligencji przy współudziale kilku chińskich uniwersytetów. Wyróżnia się tym, że uwzględnia do 200 tys. tokenów kontekstowych i obsługuje nie tylko język angielski, ale także chiński. W wielu testach model ten jest zbliżony do GPT-4.



Dodatkowo opracowano 84 nowe jądra mnożenia macierzy dla zestawu narzędzi llamafile, opracowanego przez Mozillę w celu tworzenia plików wykonywalnych ogólnego przeznaczenia do uruchamiania dużych modeli języków uczenia maszynowego (LLM). Zmiany te pozwoliły znacząco przyspieszyć pracę modeli w pliku llamafile wykonywanych na procesorze. Przykładowo, wykonywanie modeli przy użyciu llamafile jest teraz szybsze od wykonywania modeli przy użyciu llama.cpp o 30–500%, w zależności od środowiska, a w porównaniu do biblioteki MKL, operacje macierzowe mieszczące się w pamięci podręcznej L2 są wykonywane dwa razy szybciej w nowej implementacji.
Źródło: opennet.ru
