Google ha presentato il modello linguistico compatto Gemma 2 2B, che supera GPT 3.5 Turbo

Azienda Google ha presentato Gemma 2 2B è un modello di linguaggio compatto ma potente di intelligenza artificiale (LLM), in grado di competere con i leader del settore, nonostante le sue dimensioni sensibilmente inferiori. Il nuovo modello contiene appena 2,6 miliardi di parametri e dimostra prestazioni paragonabili a quelle di modelli molto più grandi, tra cui OpenAI GPT-3.5 e Mistral AI Mixtral 8x7B.

Google ha presentato il modello linguistico compatto Gemma 2 2B, che supera GPT 3.5 Turbo

Nel test LMSYS Chatbot Arena, una popolare piattaforma online per il confronto e la valutazione della qualità dei modelli di intelligenza artificiale, Gemma 2 2B ha ottenuto 1130 punti. Questo risultato supera leggermente quelli di GPT-3.5-Turbo-0613 (1117 punti) e Mixtral-8x7B (1114 punti), modelli che hanno dieci volte il numero di parametri.

Google ha presentato il modello linguistico compatto Gemma 2 2B, che supera GPT 3.5 Turbo

Google riporta che Gemma 2 2B ha anche ottenuto 56,1 punti nel test MMLU (Massive Multitask Language Understanding) e 36,6 punti nel test MBPP (Mostly Basic Python Programming), un notevole miglioramento rispetto alla versione precedente.

Gemma 2 2B sfida l'opinione comune secondo cui i modelli di linguaggio più grandi funzionano sempre meglio di quelli compatti. Le prestazioni di Gemma 2 2B dimostrano che metodi di apprendimento complessi, l'efficienza dell'architettura e set di dati di alta qualità possono compensare un numero inferiore di parametri. Lo sviluppo di Gemma 2 2B sottolinea inoltre l'importanza crescente dei metodi di compressione e distillazione dei modelli AI. La capacità di compilare efficacemente le informazioni da modelli più grandi a modelli più piccoli apre opportunità per creare strumenti di AI più accessibili, senza compromettere le loro prestazioni.

Google ha addestrato Gemma 2 2B su un vasto set di dati di 2 trilioni di token, utilizzando sistemi basati sui propri acceleratori AI TPU v5e. Il supporto per più lingue amplifica il suo potenziale per applicazioni globali. Il modello Gemma 2 2B è a codice aperto. I ricercatori e gli sviluppatori possono accedere al modello tramite la piattaforma Hugging Face. Supporta anche vari framework, tra cui PyTorch e TensorFlow.

Fonte:


Fonte: 3dnews.ru
Acquista hosting affidabile per siti web con protezione DDoS, VPS VDS server 🔥 Acquista hosting affidabile per siti web con protezione DDoS, VPS VDS server | ProHoster