Kompania Microsoft tekste të burimeve të bibliotekës së mësimit të makinave (Tree Tree dhe Grafiku i Ndashjes) me implementimin e algoritmit për kërkimin afër . Biblioteka në njësinë hulumtuese Microsoft Research dhe Qendrën e Zhvillimit të Teknologjive të Kërkimit (Microsoft Search Technology Center). Në praktikë, SPTAG është përdorur në sistemin e kërkimit Bing për të përcaktuar rezultatet më relevante në varësi të kontekstit të kërkesave të kërkimit. Kodi është shkruar në gjuhën C++ dhe nën licencën MIT. Mbështetet ndërtimi për Linux dhe Windows. Ka një mbështetje për gjuhën Python.
Megjithëse idetë për aplikimin e magazinave vektorike në sistemet e kërkimit kanë qenë rreth e rrotull për një kohë të gjatë, implementimi i tyre pengohet nga kërkesat e larta për burime dhe kufizimet në shkallëzueshmëri. Kombinimi i metodave të thella të mësimit të makinave me algoritmet për kërkimin afër fqinjit më të afërt ka lejuar përmirësimin e performancës dhe shkallëzueshmërisë së sistemeve vektorike në një nivel të pranueshëm për sistemet e mëdha të kërkimit. Për shembull, në Bing, për indekset vektorike me më shumë se 150 miliard vektorë, koha e marrjes së rezultateve më relevante është brenda 8 ms.
Biblioteka përmban mjete për ndërtimin e indekseve dhe organizimin e kërkimeve me vektorë, si dhe një grup mjetesh për mbështetje të një sistemi të shpërndarë të kërkimit online, që mbulon koleksione shumë të mëdha vektorësh. module të mëposhtme: ndërtues indeksi për indeksimin, kërkues për kërkimin duke përdorur indeksin, të shpërndarë në një klaster me disa nyje, server për të drejtuar përpunuesit në nyje, Agregator për të bashkuar disa serverë në një të vetme dhe klient për të dërguar kërkesat. Mbështetet për përfshirjen e vektorëve të rinj në indeks dhe për heqjen e vektorëve në flukse.
Biblioteka parashikon që të dhënat e përpunuara dhe të paraqitura në koleksion janë të formalizuara në forma të lidhura vektorësh, të cilat mund të krahasohen në bazë të (L2) ose Për kërkesat e kërkimit kthehen vektorët, për të cilët distanca midis tyre dhe vektorit origjinal është minimu.) dhe grafiku i fqinjëve të përbashkët k-means tree
dhe grafiku i fqinjëve të përbashkët). Metoda e parë kërkon më pak burime gjatë punës me indeksin, ndërsa e dyta demonstron një sakësi më të lartë të rezultateve të kërkimit në koleksione shumë të mëdha vektorësh.
Burimi: opennet.ru
