
Uue keelemudeli arhitektuur sarnaneb Llama või Qweniga, kuid see on täielikult nullist koolitatud. Sarnasus võimaldab kasutada sama tööriistakomplekti. YandexGPT 5 Lite pretrain-versioon on suur keelemudel, millel on 8B parameetrit ja konteksti pikkus 32k tokenit. Mudeli koolitamisel pöörati erilist tähelepanu vene keelele, vene keelest koostatud materjalid moodustasid üle 70% andmekogust.
Vanem YandexGPT 5 mudel on saadaval Alises ja Yandexi veebisaidil, kuid seda ei avalikustata.
Oma kategoorias saavutab mudel taseme maailmas tuntud SOTA-ga mitmete võtmebenchmarkide järgi pretrain-mudelite jaoks, ja paljude teiste puhul ületab need. Näiteks sisemiste pimedate paaride võrdluse (side-by-side) tulemuste kohaselt ületab YandexGPT 5 Pro YandexGPT 4 Pro 67% juhtudest ja ei jää alla GPT-4o-le.
Allikas: linux.org.ru
