
Architektura nowego modelu językowego jest podobna do Llama lub Qwen, ale została w całości wytrenowana od zera. Podobieństwo umożliwia korzystanie z tego samego zestawu narzędzi. Wersja pretrain dużego modelu językowego YandexGPT 5 Lite z 8B parametrów i kontekstem 32k tokenów. Podczas szkolenia modelu szczególną uwagę zwrócono na język rosyjski, materiały w języku rosyjskim stanowiły ponad 70% zbioru danych.
Starszy model YandexGPT 5 jest dostępny w Alice i na stronie Yandexa, ale nie będzie udostępniony publicznie.
W swojej kategorii model osiąga parytet z światowym SOTA w wielu kluczowych benchmarkach dla modeli pretrain, a w wielu innych je przewyższa. Na przykład, według wyników wewnętrznego, ślepego porównania (side-by-side) dla szerokiego strumienia zapytań YandexGPT 5 Pro przewyższa YandexGPT 4 Pro w 67% przypadków i nie ustępuje GPT-4o.
Źródło: linux.org.ru
