
Die Architektur des neuen Sprachmodells Ă€hnelt der von Llama oder Qwen, wurde jedoch von Grund auf neu trainiert. Die Ăhnlichkeit ermöglicht die Verwendung desselben Werkzeugs. Die Pretrain-Version des groĂen Sprachmodells YandexGPT 5 Lite hat 8B Parameter und eine KontextlĂ€nge von 32k Tokens. Beim Training des Modells wurde besonderes Augenmerk auf die russische Sprache gelegt, Materialien in russischer Sprache machten ĂŒber 70 % des Datensatzes aus.
Das gröĂere Modell YandexGPT 5 ist in Alice und auf der Yandex-Website, wird jedoch nicht öffentlich zugĂ€nglich gemacht werden.
In seiner Kategorie erreicht das Modell ParitĂ€t mit den globalen SOTA in einer Reihe von SchlĂŒsselbenchmarks fĂŒr Pretrain-Modelle und ĂŒbertrifft sie in vielen anderen. Beispielsweise ĂŒbertrifft YandexGPT 5 Pro in 67 % der FĂ€lle YandexGPT 4 Pro in einer internen blindvergleichenden Studie (side-by-side) fĂŒr einen breiten Anfragenstrom und steht GPT-4o in nichts nach.
Quelle: linux.org.ru
