Компания Jina открыла под лицензией Apache 2.0 модель машинного обучения для векторного представления текста — jina-embeddings-v2. Модель позволяет преобразовать произвольный текст, включающий до 8192 знаков, в небольшую последовательность вещественных чисел, образующих вектор, сопоставленный с исходным текстом и воспроизводящий его семантику (смысл). Jina Embedding стала первой открытой моделью машинного обучения, обладающей характеристиками, не уступающими проприетарной модели векторизации текста от проекта OpenAI (text-embedding-ada-002), также способной обрабатывать тексты, насчитывающие до 8192 токенов.
Distanca midis dy vektorëve të formuar mund të përdoret për të përcaktuar lidhjen semantike mes teksteve origjinale. Në praktikë, vektorët e formuar mund të aplikohen për analizën e ngjashmërisë së teksteve, organizimin e kërkimeve për materiale me tema të ngjashme (renditja e rezultateve sipas afërsisë semantike), grupimin e teksteve sipas kuptimit, formimin e rekomandimeve (propozimi i një liste të rreshtave të ngjashëm tekstual), identifikimin e anomalive, përcaktimin e plagjiaturës dhe klasifikimin e testeve. Si shembuj të përdorimit përmenden angazhimi i modelit për analizën e dokumenteve ligjore, për analizën e biznesit, në kërkime medicale për përpunimin e artikujve shkencorë, në kritikën letrare, për analizimin e raporteve financiare dhe për përmirësimin e cilësisë së përpunimit të pyetjeve të ndërlikuara nga chatbot-et.
Для загрузки доступны два варианта модели jina-embeddings (базовая — 0.27 ГБ и сокращённая — 0.07 ГБ), обученные на 400 миллионах пар текстовых последовательностей на английском языке, охватывающих различные области знаний. При обучении использовались последовательности, размером 512 токенов, которые были экстраполированы до размера 8192 при помощи метода ALiBi (Attention with Linear Biases).
Modeli bazë përfshin 137 milion parametra dhe është e dizajnuar për t'u përdorur në sisteme stacionare me GPU. Modeli i shkurtuar përmban 33 milion parametra, ofron saktësi më të ulët dhe është i fokusuar në aplikimin në pajisje celulare dhe në sisteme me kapacitete të vogla memorjeje. Së shpejti planifikohet të publikohet një model i madh që do të mbuloj 435 milion parametra. Po ashtu, është duke u zhvilluar një version shumëgjuhësh të modelit, i cili aktualisht përqendrohet në mbështetje të të gjuhëve gjermane dhe spanjolle. Një plugin është përgatitur veçmas për të përdorur modelin jina-embeddings nëpërmjet mjeteve të LLM.
Burimi: opennet.ru
