La empresa Google ha publicado una nueva familia de grandes modelos de lenguaje, Gemma 4, basados en la tecnología del modelo Gemini 3. Gemma 4 se distribuye bajo una licencia Apache en variantes con 2.3, 4.5, 25.2 y 30.7 mil millones de parámetros (E2B, E4B, 31B y 26B A4B). Las variantes E2B y E4B son adecuadas para su uso en dispositivos móviles, sistemas de Internet de las cosas (IoT) y placas tipo Raspberry Pi, mientras que las otras variantes son idóneas para estaciones de trabajo y sistemas con GPU de consumo. El tamaño del contexto considerado por el modelo es de 128 mil tokens para los modelos E2B y E4B, y de 256 mil tokens para los modelos 31B y 26B A4B.
Los modelos son multilingües y multimodales: de forma predeterminada, admiten 35 idiomas (se han utilizado más de 140 idiomas en el entrenamiento), y pueden procesar texto e imágenes (los modelos E2B y E4B además admiten el procesamiento de audio). El modelo 26B A4B se basa en la arquitectura MoE (Mixture-of-Experts), en la que el modelo se divide en una serie de redes expertas (solo se pueden usar 3.8 mil millones de parámetros para generar una respuesta, pero la velocidad es significativamente superior a la de los grandes modelos clásicos), mientras que las otras variantes utilizan una arquitectura monolítica clásica.
Los modelos admiten razonamientos y modos de pensamiento configurables, soportan el papel del sistema (System Role) para procesar instrucciones (reglas, limitaciones) separadamente de los datos. Los modelos pueden utilizarse para escribir código, reconocimiento de objetos en imágenes, análisis cuadro por cuadro de video, análisis de documentos y PDF, reconocimiento óptico de texto impreso y manuscrito (OCR), reconocimiento de voz y traducción entre idiomas. Es posible utilizarlos como agentes autónomos que interactúan con diversas herramientas y API.
En la mayoría de las pruebas, los modelos de la serie Gemma 4 han superado significativamente al modelo Gemma 3 con 27 mil millones de parámetros. Se admite el uso de Gemma 4 con herramientas y bibliotecas como LiteRT-LM, vLLM, llama.cpp, MLX, Ollama, NVIDIA NIM y NeMo, LM Studio, Unsloth, SGLang, Cactus, Basetan, MaxText, Tunix y Keras.


Fuente: opennet.ru
