Das Unternehmen Google hat eine neue Familie großer Sprachmodelle namens Gemma 4 veröffentlicht, die auf der Technologie des Modells Gemini 3 basieren. Gemma 4 wird unter einer Apache-Lizenz mit Varianten von 2,3, 4,5, 25,2 und 30,7 Milliarden Parametern (E2B, E4B, 31B und 26B A4B) angeboten. Die Varianten E2B und E4B eignen sich für die Verwendung auf mobilen Geräten, Internet-of-Things-Systemen (IoT) und Platinen wie Raspberry Pi, während die anderen Varianten für den Einsatz auf Workstations und Systemen mit Verbrauchergrafikprozessoren geeignet sind. Die von den Modellen berücksichtigte Kontextgröße beträgt 128.000 Token für die Modelle E2B und E4B und 256.000 Token für die Modelle 31B und 26B A4B.
Die Modelle sind mehrsprachig und multimodal: Out-of-the-Box werden 35 Sprachen unterstützt (bei der Schulung wurden mehr als 140 Sprachen verwendet), und es können sowohl Text als auch Bilder verarbeitet werden (die Modelle E2B und E4B unterstützen zusätzlich die Verarbeitung von Audio). Das Modell 26B A4B basiert auf der MoE-Architektur (Mixture-of-Experts), bei der das Modell in eine Reihe von Expertensystemen unterteilt ist (bei der Generierung einer Antwort können nur 3,8 Milliarden Parameter verwendet werden, jedoch ist die Geschwindigkeit deutlich höher als bei klassischen großen Modellen), während die anderen Varianten die klassische monolithische Architektur verwenden.
Die Modelle unterstützen solches Denken und anpassbare Denkmodi und bieten eine Systemrolle für die Verarbeitung von Anweisungen (Regeln, Einschränkungen) getrennt von den Daten. Die Modelle können zum Schreiben von Code, zur Objekterkennung in Bildern, zur Einzelbildanalyse von Videos, zur Analyse von Dokumenten und PDFs, zur optischen Zeichenerkennung von gedrucktem und handgeschriebenem Text (OCR), zur Spracherkennung und zum Übersetzen zwischen Sprachen verwendet werden. Es ist möglich, sie als autonome Agenten zu verwenden, die mit verschiedenen Werkzeugen und APIs interagieren.
In den meisten Tests übertrafen die Modelle der Reihe Gemma 4 die Modelle Gemma 3 mit 27 Milliarden Parametern erheblich. Die Verwendung von Gemma 4 mit Werkzeugen und Bibliotheken wie LiteRT-LM, vLLM, llama.cpp, MLX, Ollama, NVIDIA NIM und NeMo, LM Studio, Unsloth, SGLang, Cactus, Basetan, MaxText, Tunix und Keras wird unterstützt.


Quelle: opennet.ru
