Google zaprezentowała kompaktowy model językowy Gemma 2 2B, który przewyższa GPT 3.5 Turbo

Firma Google przedstawiła Gemma 2 2B — kompaktowy, ale potężny model językowy sztucznej inteligencji (LLM), który może konkurować z liderami branży, mimo znacznie mniejszych rozmiarów. Nowy model językowy zawierający zaledwie 2,6 miliarda parametrów wykazuje wydajność porównywalną z dużo większymi odpowiednikami, w tym OpenAI GPT-3.5 i Mistral AI Mixtral 8x7B.

Google zaprezentowała kompaktowy model językowy Gemma 2 2B, który przewyższa GPT 3.5 Turbo

W teście LMSYS Chatbot Arena, popularnej platformy online do porównywania i oceny jakości modeli sztucznej inteligencji, Gemma 2 2B zdobyła 1130 punktów. Wynik ten nieznacznie przewyższa wyniki GPT-3.5-Turbo-0613 (1117 punktów) i Mixtral-8x7B (1114 punktów)— modeli, które mają dziesięciokrotnie więcej parametrów.

Google zaprezentowała kompaktowy model językowy Gemma 2 2B, który przewyższa GPT 3.5 Turbo

Google informuje, że Gemma 2 2B zdobyła również 56,1 punktu w teście MMLU (Massive Multitask Language Understanding) oraz 36,6 punktu w teście MBPP (Mostly Basic Python Programming), co stanowi znaczną poprawę w porównaniu do poprzedniej wersji.

Gemma 2 2B podważa powszechne przekonanie, że większe modele językowe pierwotnie działają lepiej niż kompaktowe. Wydajność Gemma 2 2B pokazuje, że skomplikowane metody uczenia, efektywność architektury i wysokiej jakości zbiory danych mogą zrekompensować brak liczby parametrów. Opracowanie Gemma 2 2B podkreśla także rosnące znaczenie metod kompresji i destylacji modeli AI. Możliwość efektywnego kompilowania informacji z większych modeli do mniejszych otwiera możliwości tworzenia bardziej dostępnych narzędzi AI, nie rezygnując z ich wydajności.

Google wytrenowało Gemma 2 2B na ogromnym zbiorze danych składającym się z 2 bilionów tokenów, wykorzystując systemy oparte na własnych akceleratorach AI TPU v5e. Wsparcie dla wielu języków poszerza jej potencjał zastosowań w globalnych aplikacjach. Model Gemma 2 2B jest otwartoźródłowy. Badacze i deweloperzy mogą uzyskać dostęp do modelu za pośrednictwem platformy Hugging Face. Obsługuje również różne frameworki, w tym PyTorch i TensorFlow.

Źródło:


Źródło: 3dnews.ru
Kup solidny hosting stron z ochroną przed DDoS, serwery VPS VDS 🔥 Kup solidny hosting stron z ochroną przed DDoS, serwery VPS VDS | ProHoster