La empresa Databricks ha anunciado la apertura de un gran modelo de lenguaje DBRX, que puede ser utilizado para crear chatbots que respondan preguntas en lenguaje natural, resolver problemas matemáticos propuestos, generar contenido sobre un tema específico y crear código en varios lenguajes de programación. Este modelo fue desarrollado por Mosaic ML, que fue adquirida por Databricks por 1.3 mil millones de dólares. Para su entrenamiento se utilizó un clúster de 3072 GPU NVIDIA H100 Tensor Core. Se recomienda 320GB de memoria para ejecutar el modelo listo.
Durante el entrenamiento del modelo se utilizó la arquitectura MoE (Mixture of Experts), que permite obtener una evaluación experta más precisa, y una colección de textos y códigos de 12 TB. El tamaño del contexto considerado por el modelo DBRX es de 32 mil tokens (número de tokens que el modelo puede procesar y recordar al generar texto). En comparación, el tamaño del contexto de los modelos Google Gemini y OpenAI GPT-4 es de 32 mil tokens, Google Gemma — 8 mil, y el modelo GPT-4 Turbo — 128 mil.
El modelo abarca 132 mil millones de parámetros y está dividido en 16 redes expertas, de las cuales pueden utilizarse hasta 4 al procesar una consulta (cubriendo no más de 36 mil millones de parámetros por cada token). Para compararlo, se presume que el modelo GPT-4 incluye 1.76 billones de parámetros, el recientemente presentado modelo Grok (X/Twitter) — 314 mil millones, GPT-3.5 — 175 mil millones, YaLM (Yandex) — 100 mil millones, LLaMA (Meta) — 65 mil millones, GigaChat (Sber) — 29 mil millones, y Gemma (Google) — 7 mil millones.
El modelo y los componentes relacionados se distribuyen bajo la licencia Databricks Open Model License, que permite usar, reproducir, copiar, modificar y crear productos derivados, pero con algunas restricciones. Por ejemplo, la licencia prohíbe usar DBRX, modelos derivados y cualquier salida basada en ellos para mejorar otros modelos de lenguaje distintos a DBRX. La licencia también prohíbe usar el modelo en áreas que violen leyes y regulaciones. Los modelos derivados deben distribuirse bajo la misma licencia. Al ser utilizados en productos y servicios que cuentan con más de 700 millones de usuarios al mes, se requiere obtener un permiso separado.
Según los creadores del modelo, por sus características y capacidades, DBRX supera a los modelos GPT-3.5 de OpenAI y Grok-1 de Twitter, y puede competir con el modelo Gemini 1.0 Pro en pruebas de comprensión del lenguaje, habilidades de escritura de código en lenguajes de programación y resolución de problemas matemáticos. En algunas aplicaciones, como la generación de consultas SQL, DBRX se acerca en eficiencia al modelo GPT-4 Turbo, que lidera el mercado. Además, el modelo se distingue de los servicios competidores por su rapidez, permitiendo la generación de respuestas casi instantáneamente. En particular, DBRX puede generar texto a una velocidad de hasta 150 tokens por segundo por usuario, lo que es aproximadamente el doble de rápido que el modelo LLaMA2-70B.


Adicionalmente, se puede destacar la publicación de la descripción técnica del modelo de lenguaje grande abierto InternLM2, que se distribuye bajo la licencia Apache 2.0, disponible en versiones con 20, 7 y 1.8 mil millones de parámetros. El modelo está siendo desarrollado por un laboratorio de inteligencia artificial en Shanghái con la participación de varias universidades chinas y es notable por considerar hasta 200K tokens de contexto y por soportar no solo el inglés, sino también el chino. En muchas pruebas, el modelo está cerca de GPT-4.



Además, se informa sobre el desarrollo de 84 nuevos núcleos de multiplicación de matrices para la herramienta llamafile, desarrollada por Mozilla, que permite crear archivos ejecutables universales para ejecutar grandes modelos de lenguaje de aprendizaje automático (LLM). Los cambios han permitido acelerar significativamente el rendimiento de los modelos en llamafile al ejecutarse en CPU. Por ejemplo, la ejecución de modelos utilizando llamafile ahora es más rápida que al usar llama.cpp entre un 30% y un 500% dependiendo del entorno, y en comparación con la biblioteca MKL, las operaciones de matriz que caben en la caché L2 se realizan en la nueva implementación dos veces más rápido.
Fuente: opennet.ru
