Le code de Jina Embedding, un modèle pour la représentation vectorielle du sens du texte, est ouvert.

La société Jina a lancé sous la licence Apache 2.0 un modèle d'apprentissage automatique pour la représentation vectorielle du texte - jina-embeddings-v2. Ce modèle permet de transformer un texte quelconque, comprenant jusqu'à 8192 caractères, en une courte séquence de nombres réels formant un vecteur associé au texte d'origine et reproduisant sa sémantique. Jina Embedding est devenu le premier modèle d'apprentissage automatique ouvert, possédant des caractéristiques comparables à celles du modèle propriétaire de vectorisation de texte du projet OpenAI (text-embedding-ada-002), capable également de traiter des textes allant jusqu'à 8192 tokens.

La distance entre deux vecteurs formés peut être utilisée pour déterminer la relation sémantique des textes d'origine. En pratique, les vecteurs formés peuvent être utilisés pour analyser la similarité des textes, organiser la recherche de matériaux similaires par thème (classement des résultats selon la proximité sémantique), grouper les textes par sens, formuler des recommandations (proposer une liste de lignes de texte similaires), détecter les anomalies, identifier le plagiat et classer des tests. Parmi les exemples de domaines d'utilisation, on mentionne l'utilisation du modèle pour l'analyse de documents juridiques, pour l'analyse commerciale, dans la recherche médicale pour le traitement d'articles scientifiques, dans la critique littéraire, pour l'analyse des états financiers et pour améliorer la qualité du traitement des questions complexes par les chatbots.

Deux variantes du modèle jina-embeddings sont disponibles en téléchargement (base - 0,27 Go et réduite - 0,07 Go), entraînées sur 400 millions de paires de séquences textuelles en anglais, couvrant divers domaines de connaissances. Lors de l'entraînement, des séquences de 512 tokens ont été extrapolées à une taille de 8192 à l'aide de la méthode ALiBi (Attention with Linear Biases).

Le modèle de base comprend 137 millions de paramètres et est conçu pour une utilisation sur des systèmes de bureau avec GPU. Le modèle réduit comprend 33 millions de paramètres, offre une précision inférieure et est destiné à être utilisé sur des appareils mobiles et des systèmes avec une capacité de mémoire limitée. Une grande modèle qui couvrira 435 millions de paramètres sera également publiée prochainement. Un variant multilingue du modèle est également en cours de développement, actuellement axé sur le support des langues allemande et espagnole. Un plugin a été préparé séparément pour utiliser le modèle jina-embeddings via l'outil LLM.

Source : opennet.ru

Acheter un hébergement fiable pour les sites avec protection DDoS, serveurs VPS VDS 🔥 Acheter un hébergement fiable pour les sites avec protection DDoS, serveurs VPS VDS | ProHoster