Firma Jina udostępniła pod licencją Apache 2.0 model uczenia maszynowego do wektorowego przedstawienia tekstu — jina-embeddings-v2. Model ten umożliwia przekształcanie dowolnego tekstu, zawierającego do 8192 znaków, w małą sekwencję liczb rzeczywistych, tworzącą wektor, który odpowiada oryginalnemu tekstowi i odzwierciedla jego semantykę (sens). Jina Embedding stała się pierwszym otwartym modelem uczenia maszynowego, który oferuje cechy porównywalne do własnościowego modelu wektorowania tekstu od projektu OpenAI (text-embedding-ada-002) i również jest w stanie przetwarzać teksty liczące do 8192 tokenów.
Odległość między dwoma uformowanymi wektorami można wykorzystać do określenia semantycznych powiązań między oryginalnymi tekstami. W praktyce uformowane wektory mogą być używane do analizy podobieństwa tekstów, organizowania wyszukiwania materiałów zbliżonych tematycznie (rankowanie wyników według bliskości semantycznej), grupowania tekstów według sensu, formułowania rekomendacji (propozycja listy podobnych linii tekstowych), wykrywania anomalii, określania plagiatu oraz klasyfikowania testów. Jako przykłady zastosowań wymienia się wykorzystanie modelu do analizy dokumentów prawnych, analityki biznesowej, w badaniach medycznych do przetwarzania artykułów naukowych, w krytyce literackiej, do analizy raportów finansowych oraz do poprawy jakości obsługi skomplikowanych zapytań przez chatboty.
Do pobrania dostępne są dwa warianty modelu jina-embeddings (podstawowy — 0,27 GB i skrócony — 0,07 GB), przeszkolone na 400 milionach par sekwencji tekstowych w języku angielskim, obejmujących różne dziedziny wiedzy. Podczas szkolenia używano sekwencji o długości 512 tokenów, które zostały ekstrapolowane do długości 8192 za pomocą metody ALiBi (Attention with Linear Biases).
Podstawowy model zawiera 137 milionów parametrów i jest przeznaczony do użycia na stacjonarnych systemach z GPU. Model uproszczony zawiera 33 miliony parametrów, zapewnia mniejszą dokładność i jest ukierunkowany na zastosowanie na urządzeniach mobilnych oraz w systemach z ograniczoną pamięcią. W najbliższym czasie planowane jest także opublikowanie dużego modelu, który będzie obejmował 435 milionów parametrów. W opracowaniu jest również wersja wielojęzyczna modelu, która obecnie koncentruje się na wsparciu języków niemieckiego i hiszpańskiego. Osobno przygotowano wtyczkę do korzystania z modelu jina-embeddings przez narzędzia LLM.
Źródło: opennet.ru
