Google presentó el modelo de lenguaje compacto Gemma 2 2B, que supera a GPT 3.5 Turbo

La empresa Google ha presentado Gemma 2 2B es un modelo de lenguaje compacto pero potente de inteligencia artificial (LLM), capaz de competir con los líderes de la industria a pesar de su tamaño significativamente menor. Este nuevo modelo de lenguaje, que contiene solo 2.6 mil millones de parámetros, demuestra un rendimiento comparable al de modelos mucho más grandes, incluyendo OpenAI GPT-3.5 y Mistral AI Mixtral 8x7B.

Google presentó el modelo de lenguaje compacto Gemma 2 2B, que supera a GPT 3.5 Turbo

En la prueba LMSYS Chatbot Arena, una popular plataforma en línea para la evaluación comparativa y la valoración de modelos de inteligencia artificial, Gemma 2 2B obtuvo 1130 puntos. Este resultado supera ligeramente los de GPT-3.5-Turbo-0613 (1117 puntos) y Mixtral-8x7B (1114 puntos) — modelos que poseen diez veces más parámetros.

Google presentó el modelo de lenguaje compacto Gemma 2 2B, que supera a GPT 3.5 Turbo

Google informa que Gemma 2 2B también alcanzó 56.1 puntos en la prueba MMLU (Massive Multitask Language Understanding) y 36.6 puntos en la prueba MBPP (Mostly Basic Python Programming), un progreso significativo en comparación con la versión anterior.

Gemma 2 2B desafía la creencia común de que los modelos de lenguaje más grandes siempre funcionan mejor que los compactos. Su rendimiento demuestra que las técnicas de entrenamiento avanzadas, la eficiencia de la arquitectura y los conjuntos de datos de alta calidad pueden compensar la falta de parámetros. El desarrollo de Gemma 2 2B también resalta la creciente importancia de las técnicas de compresión y destilación de modelos de IA. La capacidad de compilar información de modelos más grandes a versiones más pequeñas abre nuevas oportunidades para crear herramientas de IA más accesibles sin sacrificar el rendimiento.

Google entrenó a Gemma 2 2B en un enorme conjunto de datos de 2 billones de tokens, utilizando sistemas basados en sus aceleradores de IA TPU v5e. El soporte para varios idiomas amplía su potencial para aplicaciones globales. El modelo Gemma 2 2B tiene código abierto. Investigadores y desarrolladores pueden acceder al modelo a través de la plataforma Hugging Face. También es compatible con varios frameworks, incluyendo PyTorch y TensorFlow.

Fuente:


Fuente: 3dnews.ru
Compra un hosting fiable para sitios web con protección contra DDoS, servidores VPS VDS 🔥 Compra un hosting fiable para sitios web con protección contra DDoS, servidores VPS VDS | ProHoster