L'azienda Jina ha rilasciato sotto licenza Apache 2.0 un modello di apprendimento automatico per la rappresentazione vettoriale del testo — jina-embeddings-v2. Questo modello consente di trasformare un testo qualsiasi, che può arrivare fino a 8192 caratteri, in una breve sequenza di numeri reali, formando un vettore associato al testo originale e che ne riproduce la semantica. Jina Embedding è diventato il primo modello di apprendimento automatico open source che offre caratteristiche comparabili a quelle del modello proprietario di vettorizzazione del testo realizzato dal progetto OpenAI (text-embedding-ada-002), ed è in grado di elaborare testi fino a 8192 token.
La distanza tra due vettori formati può essere utilizzata per determinare la connessione semantica tra i testi originali. Nella pratica, i vettori formati possono essere impiegati per analizzare la similarità dei testi, organizzare ricerche di materiali affini (ordinamento dei risultati in base alla vicinanza semantica), raggruppare i testi per significato, generare raccomandazioni (proporre un elenco di righe testuali simili), identificare anomalie, determinare plagio e classificare i test. Tra gli esempi di applicazione si menzionano l'uso del modello per analizzare documenti legali, per l'analisi aziendale, in ricerche mediche per elaborare articoli scientifici, nella critica letteraria, per analizzare relazioni finanziarie e per migliorare la qualità dell’elaborazione delle domande complesse da parte dei chatbot.
Sono disponibili due varianti del modello jina-embeddings per il download (di base — 0,27 GB e ridotta — 0,07 GB), addestrate su 400 milioni di coppie di sequenze testuali in inglese, coprendo vari settori di conoscenza. Durante l'addestramento sono state utilizzate sequenze di 512 token, che sono state estrapolate fino a una dimensione di 8192 utilizzando il metodo ALiBi (Attention with Linear Biases).
Il modello base include 137 milioni di parametri ed è progettato per l'uso su sistemi desktop con GPU. Il modello ridotto include 33 milioni di parametri, offre una minore precisione ed è destinato all'uso su dispositivi mobili e su sistemi con poco spazio di memoria. A breve sarà pubblicato anche un modello più grande, che coprirà 435 milioni di parametri. È in fase di sviluppo anche una versione multilingue del modello, attualmente focalizzata sul supporto delle lingue tedesca e spagnola. È stato preparato inoltre un plugin per utilizzare il modello jina-embeddings attraverso l'interfaccia LLM.
Fonte: opennet.ru
