
L'architecture du nouveau modèle linguistique ressemble à celle de Llama ou Qwen, mais elle a été entièrement formée depuis le début. Cette similitude facilite l'utilisation des mêmes outils. La version de préformation du grand modèle linguistique YandexGPT 5 Lite compte 8 milliards de paramètres avec une longueur de contexte de 32 000 tokens. Lors de l'entraînement du modèle, une attention particulière a été accordée à la langue russe, les matériaux en russe constituant plus de 70 % du dataset.
Le modèle avancé YandexGPT 5 est disponible dans Alice et sur le site de Yandex, mais il ne sera pas rendu public.
Dans sa catégorie, le modèle atteint la parité avec les SOTA mondiaux sur plusieurs benchmarks clés pour les modèles de préformation, et dans de nombreux autres cas, il les surpasse. Par exemple, selon les résultats d'une comparaison interne en aveugle (comparaison côte à côte) pour un large éventail de requêtes, YandexGPT 5 Pro dépasse YandexGPT 4 Pro dans 67 % des cas et ne se laisse pas distancer par GPT-4o.
Source : linux.org.ru
