
Die Architektur des neuen Sprachmodells Ă€hnelt Llama oder Qwen, wurde jedoch von Grund auf neu trainiert. Diese Ăhnlichkeit ermöglicht die Verwendung der gleichen Werkzeuge. Die Pretrain-Version des groĂen Sprachmodells YandexGPT 5 Lite hat 8B Parameter und eine KontextlĂ€nge von 32k Token. Bei der Entwicklung des Modells wurde besonderes Augenmerk auf die russische Sprache gelegt, Materialien in russischer Sprache machten ĂŒber 70% des Datensatzes aus.
Das gröĂere Modell YandexGPT 5 ist in Alice verfĂŒgbar und auf der Website von Yandex, wird jedoch nicht öffentlich zugĂ€nglich gemacht.
In ihrer Kategorie erreicht das Modell ParitĂ€t mit den weltweiten SOTA in einer Reihe von SchlĂŒsselbenchmarks fĂŒr Pretrain-Modelle und ĂŒbertrifft sie in vielen anderen. Beispielsweise ĂŒbertrifft YandexGPT 5 Pro in 67% der FĂ€lle YandexGPT 4 Pro in internen blinden Paarvergleichen (side-by-side) fĂŒr einen breiten Ansturm von Anfragen und steht auf dem gleichen Niveau wie GPT-4o.
Quelle: linux.org.ru
