Google ha pubblicato una nuova famiglia di modelli linguistici di grandi dimensioni Gemma 4, basati sulla tecnologia del modello Gemini 3. Gemma 4 è distribuito con licenza Apache in versioni da 2,3, 4,5, 25,2 e 30,7 miliardi di parametri (E2B, E4B, 31B e 26B A4B). Le varianti E2B ed E4B sono adatte per l'uso su dispositivi mobili, sistemi Internet of Things (IoT) e schede tipo Raspberry Pi, mentre le altre varianti sono idonee per workstation e sistemi con GPU consumer. La dimensione del contesto considerato dal modello è di 128.000 token per i modelli E2B e E4B, e di 256.000 token per i modelli 31B e 26B A4B.
Modelli multilingue e multimodali: supportano 35 lingue direttamente dalla scatola (sono stati utilizzati più di 140 lingue per l'addestramento), e possono elaborare testo e immagini in ingresso (i modelli E2B ed E4B supportano inoltre l'elaborazione del suono). Il modello 26B A4B si basa su architettura MoE (Mixture-of-Experts), nella quale il modello è suddiviso in una serie di reti esperte (in fase di generazione della risposta possono essere utilizzati solo 3,8 miliardi di parametri, ma la velocità è notevolmente superiore rispetto ai modelli grandi classici), mentre gli altri modelli utilizzano un'architettura monolitica classica.
I modelli supportano ragionamenti e modalità di pensiero personalizzabili, consentono un ruolo sistemico (System Role) per elaborare istruzioni (regole, limitazioni) separatamente dai dati. I modelli possono essere utilizzati per scrivere codice, riconoscere oggetti nelle immagini, analizzare video fotogramma per fotogramma, elaborare documenti e PDF, riconoscere testo stampato e manoscritto (OCR), riconoscere la voce e tradurre tra lingue. È possibile utilizzarli come agenti autonomi, interagendo con vari strumenti e API.
Nei principali test, i modelli della serie Gemma 4 hanno superato significativamente il modello Gemma 3 con 27 miliardi di parametri. L'uso di Gemma 4 è supportato da strumenti e librerie come LiteRT-LM, vLLM, llama.cpp, MLX, Ollama, NVIDIA NIM e NeMo, LM Studio, Unsloth, SGLang, Cactus, Basetan, MaxText, Tunix e Keras.


Fonte: opennet.ru
