Google Gemma 2 2B — un modello linguistico compatto ma potente di intelligenza artificiale (LLM), in grado di competere con i leader del settore nonostante le sue dimensioni notevolmente ridotte. Questo nuovo modello linguistico, con soli 2,6 miliardi di parametri, mostra prestazioni comparabili a quelle di modelli molto più grandi, tra cui OpenAI GPT-3.5 e Mistral AI Mixtral 8x7B.

Nel test LMSYS Chatbot Arena, una popolare piattaforma online per il confronto e la valutazione della qualità dei modelli di intelligenza artificiale, Gemma 2 2B ha ottenuto 1130 punti. Questo risultato supera leggermente quelli di GPT-3.5-Turbo-0613 (1117 punti) e Mixtral-8x7B (1114 punti), modelli che possiedono dieci volte il numero di parametri.

Google riferisce che Gemma 2 2B ha anche ottenuto 56,1 punti nel test MMLU (Massive Multitask Language Understanding) e 36,6 punti nel test MBPP (Mostly Basic Python Programming), un notevole miglioramento rispetto alla versione precedente.
Gemma 2 2B sfida l'opinione comune secondo cui modelli linguistici più grandi funzionano intrinsecamente meglio di quelli compatti. Le prestazioni di Gemma 2 2B dimostrano che tecniche di apprendimento complesse, l'efficienza dell'architettura e set di dati di alta qualità possono compensare una minore quantità di parametri. Sviluppare Gemma 2 2B evidenzia anche l'importanza crescente delle tecniche di compressione e distillazione dei modelli di IA. La capacità di compilare informazioni in modo efficace da modelli più grandi a modelli più piccoli apre la strada alla creazione di strumenti di IA più accessibili, senza sacrificare le loro prestazioni.
Google ha addestrato Gemma 2 2B su un vasto set di dati di 2 trilioni di token, utilizzando sistemi basati sui propri acceleratori IA proprietari TPU v5e. Il supporto per più lingue amplifica il suo potenziale per l'applicazione in contesti globali. Il modello Gemma 2 2B è open source. Ricercatori e sviluppatori possono accedere al modello tramite la piattaforma . Supporta anche vari framework, tra cui e .
Fonte:
Fonte: 3dnews.ru
