Der Code von Jina Embedding, Modelle zur Vektorisierung des Textinhalts, wurde eröffnet.

Das Unternehmen Jina hat ein unter der Apache 2.0-Lizenz stehendes Modell fĂŒr maschinelles Lernen zur vektoriellen Darstellung von Texten – jina-embeddings-v2 – veröffentlicht. Das Modell ermöglicht es, beliebigen Text, der bis zu 8192 Zeichen enthĂ€lt, in eine kleine Sequenz von reellen Zahlen umzuwandeln, die einen Vektor bilden, der mit dem ursprĂŒnglichen Text korrespondiert und seine Semantik (Bedeutung) wiedergibt. Jina Embedding wurde zum ersten offenen maschinellen Lernmodell, dessen Eigenschaften den proprietĂ€ren Vektorisierungsmodellen von OpenAI (text-embedding-ada-002) in nichts nachstehen, und das ebenfalls in der Lage ist, Texte mit bis zu 8192 Tokens zu verarbeiten.

Der Abstand zwischen zwei gebildeten Vektoren kann verwendet werden, um die semantische Beziehung der ursprĂŒnglichen Texte zu bestimmen. In der Praxis können die gebildeten Vektoren zur Analyse der Ähnlichkeit von Texten, zur Organisation der Suche nach thematisch verwandten Materialien (Ranking der Ergebnisse nach semantischer NĂ€he), zur Gruppierung von Texten nach Bedeutung, zur Generierung von Empfehlungen (Vorschlag einer Liste Ă€hnlicher Textzeilen), zur Identifikation von Anomalien, zur Plagiatserkennung und zur Klassifikation von Tests eingesetzt werden. Beispiele fĂŒr Anwendungsgebiete umfassen die Analyse von juristischen Dokumenten, die GeschĂ€ftsanalyse, medizinische Forschungsarbeiten zur Verarbeitung wissenschaftlicher Artikel, literarische Kritiken, die Auswertung von Finanzberichten und die Verbesserung der QualitĂ€t von Chatbot-Anfragen zu komplexen Themen.

Es stehen zwei Varianten des Modells jina-embeddings zum Download bereit (Basis – 0,27 GB und verkĂŒrzt – 0,07 GB), die auf 400 Millionen Paaren von englischsprachigen Textsequenzen trainiert wurden, die verschiedene Wissensbereiche abdecken. Bei der Schulung wurden Sequenzen mit einer LĂ€nge von 512 Tokens verwendet, die mit der ALiBi-Methode (Attention with Linear Biases) auf eine GrĂ¶ĂŸe von 8192 extrapoliert wurden.

Das Basismodell umfasst 137 Millionen Parameter und ist fĂŒr den Einsatz auf stationĂ€ren Systemen mit GPU ausgelegt. Das vereinfachte Modell umfasst 33 Millionen Parameter, bietet geringere Genauigkeit und ist fĂŒr die Verwendung auf mobilen GerĂ€ten und Systeme mit geringem Speicher ausgelegt. In naher Zukunft wird auch ein großes Modell veröffentlicht, das 435 Millionen Parameter abdecken wird. Zudem wird an einer mehrsprachigen Version des Modells gearbeitet, die sich derzeit auf die UnterstĂŒtzung der deutschen und spanischen Sprache konzentriert. Separat wurde ein Plugin fĂŒr die Verwendung des Modells jina-embeddings ĂŒber das LLM-Toolkit vorbereitet.

Quelle: opennet.ru

60GB SSD 8Gb DDR4