Rilasciato il codice Jina Embedding, modello per la rappresentazione vettoriale del significato del testo.

L'azienda Jina ha lanciato, sotto licenza Apache 2.0, un modello di machine learning per la rappresentazione vettoriale del testo: jina-embeddings-v2. Il modello consente di trasformare qualsiasi testo, composto fino a 8192 caratteri, in una breve sequenza di numeri reali che compongono un vettore, associato al testo originale e in grado di riprodurne la semantica. Jina Embedding è diventato il primo modello di machine learning open-source con caratteristiche paragonabili a quelle del modello proprietario di vettorizzazione del testo del progetto OpenAI (text-embedding-ada-002), anch'esso capace di gestire testi contenenti fino a 8192 token.

La distanza tra due vettori generati può essere utilizzata per determinare le relazioni semantiche tra i testi originali. Nella pratica, i vettori generati possono essere impiegati per analizzare la somiglianza tra testi, organizzare la ricerca di materiali tematicamente affini (classificare i risultati per vicinanza semantica), raggruppare i testi per significato, formulare raccomandazioni (proporre un elenco di righe testuali simili), identificare anomalie, rilevare plagio e classificare test. Tra i settori di utilizzo si menziona l'analisi di documenti legali, la business analytics, la ricerca medica per l'elaborazione di articoli scientifici, la critica letteraria, l'analisi di bilanci finanziari e il miglioramento della qualità dell'elaborazione di quesiti complessi da parte dei chatbot.

Sono disponibili due versioni del modello jina-embeddings per il download (base — 0,27 GB e ridotta — 0,07 GB), addestrate su 400 milioni di coppie di sequenze testuali in inglese, coprendo vari ambiti di conoscenza. Durante l'addestramento sono state utilizzate sequenze di 512 token, che sono state successivamente estremizzate a una dimensione di 8192 mediante il metodo ALiBi (Attention with Linear Biases).

Il modello base include 137 milioni di parametri ed è progettato per essere utilizzato su sistemi fissi con GPU. Il modello ridotto include 33 milioni di parametri, garantisce una minore precisione ed è destinato all'uso su dispositivi mobili e su sistemi con poca memoria. Nei prossimi tempi è previsto anche il rilascio di un modello ampliato, che comprenderà 435 milioni di parametri. È attualmente in fase di sviluppo una versione multilingue del modello, focalizzata sul supporto delle lingue tedesca e spagnola. È stato inoltre preparato separatamente un plugin per l'uso del modello jina-embeddings tramite gli strumenti LLM.

Fonte: opennet.ru

Acquista hosting affidabile per siti web con protezione DDoS, VPS VDS server 🔥 Acquista hosting affidabile per siti web con protezione DDoS, VPS VDS server | ProHoster