
Arkitektura e modelit të ri të gjuhës është e ngjashme me Llama ose Qwen, por ajo është trajnuar krejtësisht nga fillimi. Ngjashmëria lejon përdorimin e të njëjtit mjet. Versioni Pretrain i modelit të madh gjuhësor YandexGPT 5 Lite me 8B parametra dhe gjatësi konteksti prej 32k tokenësh. Gjatë trajnimitt të modelit, u kushtua vëmendje të veçantë gjuhës ruse, materialet në rusishte përbënin më shumë se 70% të datasetit.
Modeli më i avancuar YandexGPT 5 është i disponueshëm në Alisa dhe në faqen e internetit të Yandexit, por nuk do të jetë në dispozicion për publikun e gjerë.
Në kategorinë e tij, modeli arrin barazimin me SOTA-në botërore në disa benchmark të rëndësishëm për modelet pretrain, dhe në shumë të tjera e tejkalon ato. Për shembull, sipas rezultateve të krahasimit të brendshëm të verbër (side-by-side) për një gamë të gjerë kërkesash, YandexGPT 5 Pro tejkalon YandexGPT 4 Pro në 67% të rasteve dhe nuk pësojnë nga GPT-4o.
Burimi: linux.org.ru
