A fost deschis codul Jina Embedding, un model pentru reprezentarea vectorială a semnificației textului

Compania Jina a lansat sub licența Apache 2.0 un model de învățare automată pentru reprezentarea vectorială a textului – jina-embeddings-v2. Modelul permite transformarea unui text arbitrar, care poate conține până la 8192 de caractere, într-o secvență mică de numere reale, formând un vector asociat cu textul original și reproducing semantica acestuia. Jina Embedding a devenit primul model deschis de învățare automată care are caracteristici comparabile cu modelul proprietar de vectorizare a textului de la proiectul OpenAI (text-embedding-ada-002), fiind, de asemenea, capabil să proceseze texte de până la 8192 de tokeni.

Distanța dintre cele două vectori formați poate fi utilizată pentru a determina relația semnificativă dintre textele originale. În practică, vectorii formați pot fi folosiți pentru analizarea similitudinii textelor, organizarea căutării materialelor similare în temă (clasificarea rezultatelor în funcție de apropierea semantică), gruparea textelor în funcție de sens, formarea recomandărilor (sugestie de liste cu șiruri textuale similare), identificarea anomaliilor, detectarea plagiatului și clasificarea testelor. Exemple de domenii de utilizare includ analiza documentelor juridice, analiza de afaceri, cercetări medicale pentru procesarea articolelor științifice, critică literară, analiza rapoartelor financiare și îmbunătățirea calității procesării întrebărilor complexe de către chatbot-uri.

Pentru descărcare sunt disponibile două variante ale modelului jina-embeddings (baza – 0.27 GB și cea redusă – 0.07 GB), antrenate pe 400 de milioane de perechi de secvențe textuale în limba engleză, acoperind diverse domenii de cunoștințe. În timpul antrenării, au fost utilizate secvențe de 512 tokeni, care au fost extrapolate la 8192 de tokeni prin metoda ALiBi (Attention with Linear Biases).

Modelul de bază include 137 milioane de parametri și este destinat utilizării pe sisteme desktop cu GPU. Modelul redus include 33 milioane de parametri, oferă o precizie mai mică și este destinat utilizării pe dispozitive mobile și pe sisteme cu capacitate limitată de memorie. În curând se preconizează publicarea unui model mare care va acoperi 435 milioane de parametri. De asemenea, se dezvoltă o variantă multilingvă a modelului, care se concentrează în prezent pe suportul limbilor germană și spaniolă. Un plugin a fost pregătit separat pentru utilizarea modelului jina-embeddings prin intermediul instrumentarului LLM.

Sursa: opennet.ro

Cumpără un hosting fiabil pentru site-uri cu protecție DDoS, servere VPS VDS 🔥 Cumpără un hosting fiabil pentru site-uri cu protecție DDoS, servere VPS VDS | ProHoster