
La arquitectura del nuevo modelo de lenguaje es similar a Llama o Qwen, pero se ha entrenado completamente desde cero. Esta similitud permite utilizar las mismas herramientas. La versión de preentrenamiento del gran modelo de lenguaje YandexGPT 5 Lite tiene 8B de parámetros y una longitud de contexto de 32k tokens. Al entrenar el modelo, se prestó especial atención al idioma ruso, y el material en ruso representó más del 70% del conjunto de datos.
El modelo avanzado YandexGPT 5 está disponible en Alice y en el sitio web de Yandex, pero no estará disponible públicamente.
En su categoría, el modelo alcanza paridad con los SOTA mundiales en varios benchmarks clave para modelos de preentrenamiento, y en muchos otros, los supera. Por ejemplo, según los resultados de una comparación interna ciega lado a lado para un amplio flujo de consultas, YandexGPT 5 Pro supera a YandexGPT 4 Pro en el 67% de los casos y es comparable a GPT-4o.
Fuente: linux.org.ru
