
Die Architektur des neuen Sprachmodells ähnelt der von Llama oder Qwen, wurde jedoch von Grund auf neu trainiert. Die Ähnlichkeit ermöglicht die Verwendung desselben Werkzeugs. Die Pretrain-Version des großen Sprachmodells YandexGPT 5 Lite hat 8B Parameter und eine Kontextlänge von 32k Tokens. Beim Training des Modells wurde besonderes Augenmerk auf die russische Sprache gelegt, Materialien in russischer Sprache machten über 70 % des Datensatzes aus.
Das größere Modell YandexGPT 5 ist in Alice und auf der Yandex-Website, wird jedoch nicht öffentlich zugänglich gemacht werden.
In seiner Kategorie erreicht das Modell Parität mit den globalen SOTA in einer Reihe von Schlüsselbenchmarks für Pretrain-Modelle und übertrifft sie in vielen anderen. Beispielsweise übertrifft YandexGPT 5 Pro in 67 % der Fälle YandexGPT 4 Pro in einer internen blindvergleichenden Studie (side-by-side) für einen breiten Anfragenstrom und steht GPT-4o in nichts nach.
Quelle: linux.org.ru
