Se ha abierto el código de Jina Embedding, un modelo para la representación vectorial del significado del texto.

La empresa Jina ha lanzado bajo la licencia Apache 2.0 un modelo de aprendizaje automático para la representación vectorial del texto: jina-embeddings-v2. Este modelo permite transformar cualquier texto, incluyendo hasta 8192 caracteres, en una pequeña secuencia de números reales que forman un vector, asociado con el texto original y que reproduce su semántica (significado). Jina Embedding se ha convertido en el primer modelo de aprendizaje automático abierto que posee características que no le desmerecen frente al modelo propietario de vectorización de texto del proyecto OpenAI (text-embedding-ada-002) y que también es capaz de procesar textos de hasta 8192 tokens.

La distancia entre dos vectores formados se puede utilizar para determinar la relación semántica entre los textos originales. En la práctica, los vectores formados pueden usarse para analizar la similitud de textos, organizar la búsqueda de materiales temáticamente cercanos (ordenando los resultados por cercanía semántica), agrupando textos por significado, generando recomendaciones (ofreciendo una lista de líneas textuales similares), detectando anomalías, identificando plagio y clasificando pruebas. Como ejemplos de áreas de uso se menciona la aplicación del modelo para el análisis de documentos legales, para análisis de negocios, en investigaciones médicas para procesar artículos científicos, en crítica literaria, para analizar informes financieros y para mejorar la calidad del procesamiento de consultas complejas por parte de chatbots.

Están disponibles dos versiones del modelo jina-embeddings para su descarga (la básica — 0.27 GB y la reducida — 0.07 GB), entrenadas en 400 millones de pares de secuencias de texto en inglés, abarcando diversas áreas del conocimiento. Para el entrenamiento se utilizaron secuencias de 512 tokens, que fueron extrapoladas hasta un tamaño de 8192 mediante el método ALiBi (Atención con sesgos lineales).

El modelo básico incluye 137 millones de parámetros y está diseñado para su uso en sistemas de escritorio con GPU. El modelo reducido incluye 33 millones de parámetros, ofrece menor precisión y está dirigido a su uso en dispositivos móviles y en sistemas con poca memoria. En breve, también se planea publicar un modelo grande que abarque 435 millones de parámetros. Además, se está desarrollando una versión multilingüe del modelo, que actualmente se centra en el soporte del alemán y el español. También se ha preparado un complemento para utilizar el modelo jina-embeddings a través de la herramienta LLM.

Fuente: opennet.ru

Compra un hosting fiable para sitios web con protección contra DDoS, servidores VPS VDS 🔥 Compra un hosting fiable para sitios web con protección contra DDoS, servidores VPS VDS | ProHoster