Kompania Jina ka hapur nĂ«n licencĂ«n Apache 2.0 njĂ« model tĂ« mĂ«simit tĂ« makinat pĂ«r paraqitjen vektoriale tĂ« tekstit â jina-embeddings-v2. Ky model lejon tĂ« konvertojĂ« tekst tĂ« rastĂ«sishĂ«m, qĂ« pĂ«rfshin deri nĂ« 8192 karaktere, nĂ« njĂ« sekuencĂ« tĂ« vogĂ«l numrash real, duke formuar njĂ« vektor, i cili Ă«shtĂ« i lidhur me tekstin origjinal dhe riprodhon semantikĂ«n e tij (kuptimin). Jina Embedding u bĂ« modeli i parĂ« i hapur i mĂ«simit tĂ« makinave, i cili ka karakteristika qĂ« nuk i japin pas njĂ« modeli pronĂ«sor tĂ« vektorizimit tĂ« tekstit nga projekti OpenAI (text-embedding-ada-002), gjithashtu nĂ« gjendje tĂ« trajtojĂ« tekste qĂ« kanĂ« deri nĂ« 8192 tokene.
Distanca midis dy vektorëve të formuar mund të përdoret për të përcaktuar lidhjen semantike mes teksteve origjinale. Në praktikë, vektorët e formuar mund të aplikohen për të analizuar ngjashmërinë e teksteve, për të organizuar kërkimin e materialeve të afërta tematikisht (renditja e rezultateve sipas afërsisë semantike), për të grupuar tekstet sipas kuptimit, për të krijuar rekomandime (propozimi i një liste të rreshtave të ngjashëm të teksteve), për të identifikuar anomali, për të përcaktuar plagjiaturën dhe për klasifikimin e testeve. Si shembuj të fushave të përdorimit, përmendet angazhimi i modelit për analizën e dokumenteve ligjore, për analitikën e biznesit, në kërkimin mjekësor për përpunimin e artikujve shkencorë, në kritikën letrare, për analizimin e raportet financiare dhe për përmirësimin e cilësisë së përpunimit të pyetjeve komplekse nga chatbotët.
PĂ«r shkarkim janĂ« tĂ« disponueshme dy variante tĂ« modelit jina-embeddings (bazik â 0.27 GB dhe tĂ« reduktuara â 0.07 GB), tĂ« stĂ«rvitur mbi 400 milion çiftash sekuencash tekstesh nĂ« anglisht, qĂ« mbulojnĂ« fusha tĂ« ndryshme tĂ« njohurive. GjatĂ« stĂ«rvitjes, janĂ« pĂ«rdorur sekuenca me madhĂ«si 512 tokenesh, tĂ« cilat janĂ« ekstrapoluar nĂ« madhĂ«si 8192 pĂ«rmes metodĂ«s ALiBi (VĂ«mendje me PĂ«rgjithshĂ«m Linear).
Modeli Bazik përmban 137 milion parametra dhe është projektuar për t'u përdorur në sisteme stacionare me GPU. Modeli i shkurtuar përmban 33 milion parametra, ofron saktësi më të ulët dhe është fokusuar në përdorimin në pajisje mobile dhe në sisteme me memorie të vogël. Në të ardhmen e afërt, planifikohet gjithashtu publikimi i një modeli të madh që do të përfshijë 435 milion parametra. Po ashtu, është në zhvillim një variant shumëgjuhësh i modelit, i cili aktualisht përqëndrohet në mbështetje të gjermanishtes dhe spanjishtes. Një plugin i veçantë është përgatitur për përdorimin e modelit jina-embeddings përmes mjetit LLM.
Burimi: opennet.ru
