Jina ettevõte avas Apache 2.0 litsentsi all masinõppe mudeli, mis on mõeldud teksti vektorkujutiseks — jina-embeddings-v2. Mudel võimaldab konverteerida suvalise teksti, mis sisaldab kuni 8192 märki, väikseks reaalsusnumbrite järjestuseks, mis moodustab vektori, mis on seotud algse tekstiga ja taastab selle semantika. Jina Embedding on saanud esimeseks avatud masinõppemudeliks, mille omadused ei jää alla OpenAI projekti patenditud teksti vektoreerimise mudelile (text-embedding-ada-002), suutes samuti töödelda tekste, mis sisaldavad kuni 8192 tokeni.
Kahes loodud vektori vahelise kauguse mõõtmist saab kasutada algtekstide semantilise seose määramiseks. Praktikas vahepeal loodud vektoreid saab kasutada tekstide sarnaste analüüsimiseks, teema järgi sarnaste materjalide otsingu korraldamiseks (tulemuste järjestamine semantilise läheduse järgi), tekstide rühmitamiseks nende tähenduses, soovituste koostamiseks (sarnaste tekstiridade nimekirja pakkumine), anomaaliate tuvastamiseks, plagiaadi kindlakstegemiseks ja testide klassifitseerimiseks. Kasutusaladena tuuakse näiteid, et mudelit kasutatakse juriidiliste dokumentide analüüsimiseks, äriahnalüüsiks, meditsiiniuuringutes teadusartiklite töötlemiseks, kirjanduslikuks kriitikaks, finantsaruannete analüüsimiseks ja keeruliste küsimuste töötlemise kvaliteedi parandamiseks chatbotid.
Laadimiseks on saadaval kaks varianti mudelist jina-embeddings (põhi — 0.27 GB ja lühendatud — 0.07 GB), mis on koolitatud 400 miljonil ingliskeelsel tekstijärjestusel, mis hõlmavad erinevaid teadmiste valdkondi. Koolitamisel kasutati järjestusi, mille suurus on 512 tokenit, mis olid ekstrapoleeritud suurusele 8192 ALiBi meetodi (Attention with Linear Biases) abil.
Põhimudel sisaldab 137 miljonit parameetrit ja on mõeldud kasutamiseks GPU-dega lauaarvutites. Lühendatud mudel sisaldab 33 miljonit parameetrit, pakub madalamat täpsust ning on suunatud rakendamiseks mobiilseadmetes ja väikese mälumahtuga süsteemides. Tulevikus kavatsetakse avaldada ka suurt mudelit, mis hõlmab 435 miljonit parameetrit. Töös on ka mitmekeelse versiooni arendamine, mis keskendub praegu saksa ja hispaania keele toetamisele. Eraldi on ette valmistatud pistikprogramm mudeli jina-embeddings kasutamiseks LLM tööriistade kaudu.
Allikas: opennet.ru
