L'azienda Jina ha lanciato, sotto licenza Apache 2.0, un modello di machine learning per la rappresentazione vettoriale del testo: jina-embeddings-v2. Il modello consente di trasformare qualsiasi testo, composto fino a 8192 caratteri, in una breve sequenza di numeri reali che compongono un vettore, associato al testo originale e in grado di riprodurne la semantica. Jina Embedding è diventato il primo modello di machine learning open-source con caratteristiche paragonabili a quelle del modello proprietario di vettorizzazione del testo del progetto OpenAI (text-embedding-ada-002), anch'esso capace di gestire testi contenenti fino a 8192 token.
La distanza tra due vettori generati può essere utilizzata per determinare le relazioni semantiche tra i testi originali. Nella pratica, i vettori generati possono essere impiegati per analizzare la somiglianza tra testi, organizzare la ricerca di materiali tematicamente affini (classificare i risultati per vicinanza semantica), raggruppare i testi per significato, formulare raccomandazioni (proporre un elenco di righe testuali simili), identificare anomalie, rilevare plagio e classificare test. Tra i settori di utilizzo si menziona l'analisi di documenti legali, la business analytics, la ricerca medica per l'elaborazione di articoli scientifici, la critica letteraria, l'analisi di bilanci finanziari e il miglioramento della qualità dell'elaborazione di quesiti complessi da parte dei chatbot.
Sono disponibili due versioni del modello jina-embeddings per il download (base — 0,27 GB e ridotta — 0,07 GB), addestrate su 400 milioni di coppie di sequenze testuali in inglese, coprendo vari ambiti di conoscenza. Durante l'addestramento sono state utilizzate sequenze di 512 token, che sono state successivamente estremizzate a una dimensione di 8192 mediante il metodo ALiBi (Attention with Linear Biases).
Il modello base include 137 milioni di parametri ed è progettato per essere utilizzato su sistemi fissi con GPU. Il modello ridotto include 33 milioni di parametri, garantisce una minore precisione ed è destinato all'uso su dispositivi mobili e su sistemi con poca memoria. Nei prossimi tempi è previsto anche il rilascio di un modello ampliato, che comprenderà 435 milioni di parametri. È attualmente in fase di sviluppo una versione multilingue del modello, focalizzata sul supporto delle lingue tedesca e spagnola. È stato inoltre preparato separatamente un plugin per l'uso del modello jina-embeddings tramite gli strumenti LLM.
Fonte: opennet.ru
