Google hat das kompakte Sprachmodell Gemma 2 2B vorgestellt, das GPT 3.5 Turbo übertrifft

Das Unternehmen Google hat Gemma 2 2B ist ein kompakt, aber leistungsstarkes Sprachmodell für künstliche Intelligenz (LLM), das in der Lage ist, mit den Branchenführern zu konkurrieren, trotz seiner deutlich geringeren Größe. Das neue Sprachmodell, das nur 2,6 Milliarden Parameter umfasst, zeigt eine Leistung, die der von viel größeren Konkurrenten wie OpenAI GPT-3.5 und Mistral AI Mixtral 8x7B nicht nachsteht.

Google hat das kompakte Sprachmodell Gemma 2 2B vorgestellt, das GPT 3.5 Turbo übertrifft

Im Test von LMSYS Chatbot Arena, einer beliebten Online-Plattform für den Vergleich und die Bewertung von KI-Modellen, erzielte Gemma 2 2B 1130 Punkte. Dieses Ergebnis liegt knapp über den Ergebnissen von GPT-3.5-Turbo-0613 (1117 Punkte) und Mixtral-8x7B (1114 Punkte) – Modellen mit zehnmal so vielen Parametern.

Google hat das kompakte Sprachmodell Gemma 2 2B vorgestellt, das GPT 3.5 Turbo übertrifft

Google berichtet, dass Gemma 2 2B auch 56,1 Punkte im MMLU-Test (Massive Multitask Language Understanding) und 36,6 Punkte im MBPP-Test (Mostly Basic Python Programming) erzielt hat, was eine signifikante Verbesserung im Vergleich zur vorherigen Version darstellt.

Gemma 2 2B stellt die gängige Meinung infrage, dass größere Sprachmodelle von Natur aus besser funktionieren als kompakte. Die Leistung von Gemma 2 2B zeigt, dass komplexe Lernmethoden, architektonische Effizienz und hochwertige Datensätze die fehlende Anzahl an Parametern ausgleichen können. Die Entwicklung von Gemma 2 2B hebt auch die wachsende Bedeutung von Komprimierungs- und Destillationsmethoden für KI-Modelle hervor. Die Fähigkeit, Informationen aus größeren Modellen effektiv in kleinere zu kompilieren, eröffnet Möglichkeiten zur Schaffung zugänglicherer KI-Tools, ohne deren Leistung zu opfern.

Google hat Gemma 2 2B auf einem riesigen Datensatz von 2 Billionen Token trainiert, dabei Systeme auf Basis ihrer eigenen KI-Beschleuniger TPU v5e genutzt. Die Unterstützung mehrerer Sprachen erweitert ihr Potenzial für den Einsatz in globalen Anwendungen. Das Modell Gemma 2 2B ist quelloffen. Forscher und Entwickler können auf das Modell über die Plattform Hugging Face. Es unterstützt auch verschiedene Frameworks, einschließlich PyTorch und TensorFlow.

Quelle:


Quelle: 3dnews.ru
60GB SSD 8Gb DDR4