Der Code von Jina Embedding, einem Modell zur vektoriellen Darstellung von Textinhalten, ist jetzt verfĂŒgbar.

Das Unternehmen Jina hat unter der Lizenz Apache 2.0 ein Machine-Learning-Modell fĂŒr die Vektordarstellung von Texten – jina-embeddings-v2 – veröffentlicht. Dieses Modell ermöglicht die Umwandlung beliebiger Texte von bis zu 8192 Zeichen in eine kurze Folge von reellen Zahlen, die einen Vektor bilden, der dem ursprĂŒnglichen Text zugeordnet ist und dessen Semantik (Bedeutung) widerspiegelt. Jina Embedding ist das erste Open-Source-Machine-Learning-Modell, das in seinen Eigenschaften mit dem proprietĂ€ren Vektorisierungsmodell von OpenAI (text-embedding-ada-002) vergleichbar ist und ebenfalls in der Lage ist, Texte mit bis zu 8192 Tokens zu verarbeiten.

Der Abstand zwischen zwei gebildeten Vektoren kann verwendet werden, um die semantische Beziehung zwischen den ursprĂŒnglichen Texten zu bestimmen. In der Praxis können die gebildeten Vektoren zur Analyse der Ähnlichkeit von Texten, zur Organisation der Suche nach thematisch verwandten Materialien (Ranking der Ergebnisse nach semantischer NĂ€he), zur Gruppierung von Texten nach Bedeutung, zur Generierung von Empfehlungen (Vorschlag einer Liste Ă€hnlicher Textzeilen), zur Identifizierung von Anomalien, zur PlagiatsprĂŒfung und zur Klassifizierung von Tests eingesetzt werden. Anwendungsbereiche umfassen die Analyse von juristischen Dokumenten, Business Analytics, medizinische Forschung fĂŒr die Verarbeitung wissenschaftlicher Artikel, literarische Kritik, die Analyse von Finanzberichten und die Verbesserung der QualitĂ€t der Bearbeitung komplexer Anfragen durch Chatbots.

Es stehen zwei Modelle der Jina-Embeddings zum Download zur VerfĂŒgung (Basis — 0,27 GB und Kompakt — 0,07 GB), die auf 400 Millionen Paaren von englischen Textsequenzen trainiert wurden und verschiedene Wissensbereiche abdecken. Beim Training wurden Sequenzen mit einer LĂ€nge von 512 Tokens verwendet, die mithilfe der ALiBi-Methode (Attention with Linear Biases) auf eine LĂ€nge von 8192 extrapoliert wurden.

Das Basismodell umfasst 137 Millionen Parameter und ist fĂŒr den Einsatz auf Desktop-Systemen mit GPU optimiert. Das Kompaktmodell enthĂ€lt 33 Millionen Parameter, bietet eine geringere Genauigkeit und ist fĂŒr die Verwendung auf mobilen GerĂ€ten und Systemen mit geringem Speicher konzipiert. In naher Zukunft wird auch ein großes Modell mit 435 Millionen Parametern veröffentlicht. Zudem wird an einer mehrsprachigen Variante gearbeitet, die aktuell die UnterstĂŒtzung der deutschen und spanischen Sprache fokussiert. Separat wurde ein Plugin entwickelt, um die Jina-Embeddings ĂŒber das LLM-Toolkit zu nutzen.

Quelle: opennet.ru

Erwerben Sie zuverlĂ€ssiges Hosting fĂŒr Websites mit DDoS-Schutz, VPS VDS-Server đŸ”„ Kaufen Sie zuverlĂ€ssiges Hosting fĂŒr Websites mit DDoS-Schutz, VPS VDS-Server | ProHoster