Google dévoile le modèle de langage compact Gemma 2 2B qui surpasse le GPT 3.5 Turbo

Google présenté Gemma 2 2B est un modèle de langage d'intelligence artificielle (LLM) compact mais puissant qui peut rivaliser avec les leaders du secteur malgré sa taille nettement plus petite. Avec seulement 2,6 milliards de paramètres, le nouveau modèle de langage offre des performances comparables à celles de ses pairs beaucoup plus grands, notamment OpenAI GPT-3.5 et Mistral AI Mixtral 8x7B.

Google dévoile le modèle de langage compact Gemma 2 2B qui surpasse le GPT 3.5 Turbo

Dans le test LMSYS Chatbot Arena, une plateforme en ligne populaire pour l'analyse comparative et l'évaluation de la qualité des modèles d'intelligence artificielle, Gemma 2 2B a obtenu 1130 3.5 points. Ce résultat est légèrement en avance sur les résultats de GPT-0613-Turbo-1117 (8 points) et Mixtral-7x1114B (XNUMX points) - modèles avec dix fois plus de paramètres.

Google dévoile le modèle de langage compact Gemma 2 2B qui surpasse le GPT 3.5 Turbo

Google indique que Gemma 2 2B a également obtenu un score de 56,1 au test MMLU (Massive Multitask Language Understanding) et de 36,6 au test MBPP (Mostly Basic Python Programming), qui constituent des améliorations significatives par rapport à la version précédente.

Gemma 2 2B remet en question l'idée reçue selon laquelle les modèles de langage plus grands fonctionnent intrinsèquement mieux que les plus petits. Les performances de Gemma 2 2B montrent que des méthodes de formation sophistiquées, une architecture efficace et des ensembles de données de haute qualité peuvent compenser le manque de paramètres. Le développement de Gemma 2 2B met également en évidence l’importance croissante des techniques de compression et de distillation des modèles d’IA. La possibilité de compiler efficacement des informations provenant de modèles plus grands vers des modèles plus petits ouvre la porte à des outils d’IA plus abordables sans sacrifier les performances.

Google a formé Gemma 2 2B sur un ensemble de données massif de 2 5 milliards de jetons à l'aide de systèmes alimentés par ses accélérateurs d'IA TPU v2e exclusifs. La prise en charge de plusieurs langues étend son potentiel d'utilisation dans des applications mondiales. Le modèle Gemma 2 XNUMXB est open source. Les chercheurs et les développeurs peuvent accéder au modèle via la plateforme Étreindre le visage. Il prend également en charge divers frameworks, notamment PyTorch и TensorFlow.

Source:


Source: 3dnews.ru
Achetez un hébergement fiable pour les sites avec protection DDoS, serveurs VPS VDS 🔥 Achetez un hébergement web fiable avec protection DDoS, serveurs VPS et VDS | ProHoster