Firma Google Gemma 2 2B — kompaktowy, ale potężny model językowy sztucznej inteligencji (LLM), który może konkurować z liderami branży, mimo znacznie mniejszych rozmiarów. Nowy model językowy zawierający zaledwie 2,6 miliarda parametrów wykazuje wydajność porównywalną z dużo większymi odpowiednikami, w tym OpenAI GPT-3.5 i Mistral AI Mixtral 8x7B.

W teście LMSYS Chatbot Arena, popularnej platformy online do porównywania i oceny jakości modeli sztucznej inteligencji, Gemma 2 2B zdobyła 1130 punktów. Wynik ten nieznacznie przewyższa wyniki GPT-3.5-Turbo-0613 (1117 punktów) i Mixtral-8x7B (1114 punktów)— modeli, które mają dziesięciokrotnie więcej parametrów.

Google informuje, że Gemma 2 2B zdobyła również 56,1 punktu w teście MMLU (Massive Multitask Language Understanding) oraz 36,6 punktu w teście MBPP (Mostly Basic Python Programming), co stanowi znaczną poprawę w porównaniu do poprzedniej wersji.
Gemma 2 2B podważa powszechne przekonanie, że większe modele językowe pierwotnie działają lepiej niż kompaktowe. Wydajność Gemma 2 2B pokazuje, że skomplikowane metody uczenia, efektywność architektury i wysokiej jakości zbiory danych mogą zrekompensować brak liczby parametrów. Opracowanie Gemma 2 2B podkreśla także rosnące znaczenie metod kompresji i destylacji modeli AI. Możliwość efektywnego kompilowania informacji z większych modeli do mniejszych otwiera możliwości tworzenia bardziej dostępnych narzędzi AI, nie rezygnując z ich wydajności.
Google wytrenowało Gemma 2 2B na ogromnym zbiorze danych składającym się z 2 bilionów tokenów, wykorzystując systemy oparte na własnych akceleratorach AI TPU v5e. Wsparcie dla wielu języków poszerza jej potencjał zastosowań w globalnych aplikacjach. Model Gemma 2 2B jest otwartoźródłowy. Badacze i deweloperzy mogą uzyskać dostęp do modelu za pośrednictwem platformy . Obsługuje również różne frameworki, w tym i .
Źródło:
Źródło: 3dnews.ru
