Google'i ettevõte Gemma 2 2B — kompaktne, kuid võimas tehisintellekti keelemudel (LLM), mis suudab silma paista tööstuse juhtidega, hoolimata oma oluliselt väiksemast suurusest. Uus keelemudel, mis sisaldab vaid 2,6 miljardit parameetrit, näitab jõudlust, mis ei jää alla palju suurematele analoogidele, sealhulgas OpenAI GPT-3.5 ja Mistral AI Mixtral 8x7B.

LMSYS Chatbot Arena testis, populaarne veebiplatvorm tehisintellekti mudelite võrdlemiseks ja kvaliteedi hindamiseks, saavutas Gemma 2 2B 1130 punkti. See tulemus on veidi parem kui GPT-3.5-Turbo-0613 (1117 punkti) ja Mixtral-8x7B (1114 punkti) — mudelid, millel on kümme korda rohkem parameetreid.

Google teatab, et Gemma 2 2B saavutas samuti 56,1 punkti MMLU (Massive Multitask Language Understanding) testis ja 36,6 punkti MBPP (Mostly Basic Python Programming) testis, mis on märk märkimisväärsest täiustamisest võrreldes eelneva versiooniga.
Gemma 2 2B seab kahtluse alla levinud arvamuse, et suuremad keelemudelid töötavad algselt paremini kui kompaktsed. Gemma 2 2B jõudlus näitab, et keerukad õpimeetodid, arhitektuuri efektiivsus ja kvaliteetsed andmestikud võivad kompenseerida parameetrite arvu puudujääki. Gemma 2 2B arendamine rõhutab ka mudelite AI kokkusurumise ja destilleerimise meetodite kasvavat tähtsust. Võime tõhusalt koondada teavet suurematest mudelitest väiksematesse avab võimalusi luua kergesti ligipääsetavamaid AI tööriistu ilma jõudlust ohverdamata.
Google koolitas Gemma 2 2B tohutu 2 triljoni tokeni andmestiku abil, kasutades oma patenteeritud AI kiipide TPU v5e süsteeme. Mitme keele tugi laiendab tema potentsiaali globaalsetes rakendustes. Model Gemma 2 2B on avatud lähtekoodiga. Uurijad ja arendajad saavad mudelile juurde pääseda platvormi kaudu . Ta toetab ka erinevaid raamistikke, sealhulgas ja .
Allikas:
Allikas: 3dnews.ru
