Compania Google Gemma 2 2B — un model lingvistic compact, dar puternic de inteligență artificială (LLM), capabil să concureze cu liderii din industrie, în ciuda dimensiunii sale semnificativ mai mici. Noul model lingvistic, care conține doar 2,6 miliarde de parametri, demonstrează performanțe comparabile cu mult mai mari, inclusiv OpenAI GPT-3.5 și Mistral AI Mixtral 8x7B.

În testul LMSYS Chatbot Arena, o platformă online populară pentru testarea comparativă și evaluarea calității modelelor de inteligență artificială, Gemma 2 2B a obținut 1130 de puncte. Acest rezultat depășește ușor scorurile GPT-3.5-Turbo-0613 (1117 puncte) și Mixtral-8x7B (1114 puncte) — modele care au de zece ori mai mulți parametri.

Google raportează că Gemma 2 2B a obținut, de asemenea, 56,1 puncte în testul MMLU (Massive Multitask Language Understanding) și 36,6 puncte în testul MBPP (Mostly Basic Python Programming), ceea ce reprezintă o îmbunătățire semnificativă comparativ cu versiunea anterioară.
Gemma 2 2B contestă ideea general acceptată că modelele lingvistice mai mari funcționează inițial mai bine decât cele compacte. Performanța Gemma 2 2B arată că metodele de învățare avansate, eficiența arhitecturii și seturile de date de înaltă calitate pot compensa lipsa de parametri. Dezvoltarea Gemma 2 2B subliniază, de asemenea, importanța tot mai mare a metodelor de comprimare și distilare a modelelor de AI. Capacitatea de a compile informații eficient din modele mai mari în altele mai mici deschide oportunități pentru crearea unor instrumente AI mai accesibile, fără a compromite performanța acestora.
Google a antrenat Gemma 2 2B pe un set uriaș de date format din 2 trilioane de tokeni, folosind sisteme bazate pe acceleratoarele de AI TPU v5e. Suportul pentru mai multe limbi îi extinde potențialul pentru aplicații globale. Modelul Gemma 2 2B are cod sursă deschis. Cercetătorii și dezvoltatorii pot accesa modelul prin platforma . De asemenea, acesta suportă diverse cadre, inclusiv și .
Sursa:
Sursa: 3dnews.ru
