Ettevõte Google avaldas uue suure keelemudelite perekonna Gemma 4, mis põhinevad Gemini 3 mudeli tehnoloogial. Gemma 4 levitatakse Apache'i litsentsi alusel versioonides 2.3, 4.5, 25.2 ja 30.7 miljardi parameetriga (E2B, E4B, 31B ja 26B A4B). Variant E2B ja E4B sobivad kasutamiseks mobiilseadmetes, asjade interneti (IoT) süsteemides ja Raspberry Pi tüüpi plaatidel, samas kui teised variandid on sobivad tööjaamade ja tarbijate GPU-dega süsteemide jaoks. Mudeli konteksti suurus on 128 tuhat tokenit mudelite E2B ja E4B jaoks ning 256 tuhat tokenit mudelite 31B ja 26B A4B jaoks.
Mitmekeelsed ja multimodaalsed mudelid: toote kohapeal toetatakse 35 keelt (koolitamisel on kasutatud enam kui 140 keelt), ning sisendina saab töödelda teksti ja pilte (mudelid E2B ja E4B toetavad lisaks ka heli töötlemist). Mudel 26B A4B põhineb MoE (Expertide Segamine) arhitektuuril, kus mudel jaotatakse rida ekspertnettideks (vastuse genereerimisel saab kasutada vaid 3,8 miljardit parameetrit, kuid kiirus on oluliselt kõrgem kui klassikalistel suurte mudelite puhul), samas kui ülejäänud variandid kasutavad klassikalist monoliitset arhitektuuri.
Mudelid toetavad arutlemist ja kohandatavaid mõtlemise režiime, toetavad süsteemset rolli (System Role) juhiste (reeglite, piirangute) töötlemiseks eraldi andmetest. Mudelid võivad olla kasutusel koodi kirjutamiseks, objektide tuvastamiseks piltidel, kaadrid-kaadrilt videote analüüsimiseks, dokumentide ja PDF-de läbi töötamiseks, trükitud ja käsitsi kirjutatud teksti optiliseks tuvastamiseks (OCR), kõnetuvastamiseks ja keelte vaheliseks tõlkimiseks. Neid on võimalik kasutada autonoomsete agentidena, kes suhtlevad erinevate tööriistade ja API-dega.
Enamikus testides on Gemma 4 seeria mudelid oluliselt ületanud Gemma 3 mudelit, millel on 27 miljardit parameetrit. Gemma 4 toetab kasutamist koos tööriistade ja raamatukogudega nagu LiteRT-LM, vLLM, llama.cpp, MLX, Ollama, NVIDIA NIM ja NeMo, LM Studio, Unsloth, SGLang, Cactus, Basetan, MaxText, Tunix ja Keras.


Allikas: opennet.ru
