Me mjekër, në syze të errëta dhe në profil: situata të vështira për vizionin kompjuterik

Me mjekër, në syze të errëta dhe në profil: situata të vështira për vizionin kompjuterik

Teknologjit dhe modelet pĂ«r sistemin tonĂ« tĂ« ardhshĂ«m tĂ« vizionit kompjuterik u krijuan dhe u pĂ«rmirĂ«suan gradualisht nĂ« projekte tĂ« ndryshme tĂ« kompanisĂ« tonĂ« — nĂ« PostĂ«, Cloud, KĂ«rkim. U zhvilluan si njĂ« djathĂ« i mirĂ« ose njĂ« konjak. NjĂ«herĂ«, ne kuptuam se rrjetet tona nervore tregojnĂ« rezultate tĂ« shkĂ«lqyera nĂ« njohjen e objekteve dhe vendosĂ«m t'i bashkojmĂ« ato nĂ« njĂ« produkt tĂ« vetĂ«m b2b — Vision, — tĂ« cilin tani e pĂ«rdorim vetĂ« dhe e ofrojmĂ« pĂ«r ju.

Sot, teknologjia jonĂ« e vizionit kompjuterik nĂ« platformĂ«n Mail.Ru Cloud Solutions po punon me sukses dhe zgjidh shumĂ« probleme praktike tĂ« ndĂ«rlikuara. Ajo bazohet nĂ« njĂ« sĂ«rĂ« rrjetesh nervore qĂ« janĂ« trajnuar nĂ« datasetet tona dhe specializohen nĂ« zgjidhjen e detyrave praktike. TĂ« gjithĂ« shĂ«rbimet funksionojnĂ« nĂ« kapacitetet tona serverike. Mund tĂ« integroni nĂ« aplikacionet tuaja API-nĂ« publike tĂ« Vision, pĂ«rmes sĂ« cilĂ«s janĂ« tĂ« disponueshme tĂ« gjitha mundĂ«sitĂ« e shĂ«rbimit. API Ă«shtĂ« me shpejtĂ«si tĂ« lartĂ« — falĂ« GPU-ve serverike, koha mesatare e pĂ«rgjigjes brenda rrjetit tonĂ« Ă«shtĂ« rreth 100 ms.

Hyni në seksionin e mëposhtëm, aty do të gjeni tregimin e detajuar dhe shumë shembuj të funksionimit të Vision.

Si njĂ« shembull tĂ« shĂ«rbimit qĂ« ne vetĂ« pĂ«rdorim teknologjitĂ« e pĂ«rmendura tĂ« njohjes sĂ« fytyrĂ«s, mund tĂ« pĂ«rmendim Ngjarjet. NjĂ« nga komponentĂ«t e tij janĂ« kioskat fotografike Vision, tĂ« cilat vendosim nĂ« konferenca tĂ« ndryshme. NĂ«se ju afroheni njĂ« kioske tĂ« tillĂ«, do tĂ« fotografoheni nĂ« kamerĂ«n e integruar dhe do tĂ« futni emailin tuaj, sistemi menjĂ«herĂ« do tĂ« gjejĂ« mes fotografive tĂ« shumta ato qĂ« ju kanĂ« kapur fotografĂ«t e konferencĂ«s, dhe nĂ«se dĂ«shironi, do t'ju dĂ«rgojĂ« fotografitĂ« e gjetura nĂ« email. Dhe nuk bĂ«het fjalĂ« pĂ«r foto portrete tĂ« stilizuara — Vision ju njeh edhe nĂ« sfondin mĂ« tĂ« largĂ«t nĂ« turmĂ«n e vizitorĂ«ve. Sigurisht, kioskat nuk njohin vetĂ«, ato janĂ« thjesht tableta nĂ« mbĂ«shtetje tĂ« bukur, tĂ« cilat thjesht fotografoni mysafirĂ«t me kamerat e tyre tĂ« integruara dhe transferojnĂ« informacionin nĂ« serverat, ku ndodh e gjithĂ« magia e njohjes. Dhe ne kemi parĂ« shpesh se sa befasuese Ă«shtĂ« efikasiteti i teknologjisĂ«, madje edhe pĂ«r specialistĂ«t e njohjes sĂ« imazheve. MĂ« poshtĂ« do t'ju tregojmĂ« disa shembuj.

Luaj videon

1. Modeli ynë të Njohjes së Fytyrës

1.1. Rrjeti nervor dhe shpejtësia e përpunimit

Për njohjen e fytyrave përdorim një modifikim të modelit të rrjetit nervor ResNet 101. Average Pooling në fund është zëvendësuar me një shtresë të plotë lidhëse, siç është bërë në ArcFace. Megjithatë, madhësia e paraqitjeve vektoriale është 128, në vend të 512. Grupi ynë i trajnuar përmban rreth 10 milion fotografi të 273,593 personave.

Modeli punon shumĂ« shpejt falĂ« strukturĂ«s sĂ« zgjedhur me kujdes tĂ« konfigurations serverike dhe llogaritjeve nĂ« GPU. Koha e pĂ«rgjigjes nga API nĂ« rrjetet tona tĂ« brendshme Ă«shtĂ« nga 100 ms — kjo pĂ«rfshin identifikimin e fytyrĂ«s (zbulim i fytyrĂ«s nĂ« foto), njohjen dhe kthimin e PersonID nĂ« pĂ«rgjigjen e API. PĂ«r volume mĂ« tĂ« mĂ«dha tĂ« tĂ« dhĂ«nave hyrĂ«se — fotografi dhe video — do tĂ« nevojitet shumĂ« mĂ« shumĂ« kohĂ« pĂ«r kalimin e tĂ« dhĂ«nave nĂ« shĂ«rbim dhe pĂ«r marrjen e pĂ«rgjigjes.

1.2. Vlerësimi i efikasitetit të modelit

Por, përcaktimi i efikasitetit të punës së rrjeteve nervore është një detyrë shumë e paqartë. Cilësia e punës së tyre varet nga datasetet mbi të cilat janë trajnuar modelet dhe nëse ato janë optimizuar për të punuar me të dhëna të caktuara.

Ne filluam tĂ« vlerĂ«sojmĂ« saktĂ«sinĂ« e modelit tonĂ« me testin popullor tĂ« verifikimit LFW, por ai Ă«shtĂ« shumĂ« i vogĂ«l dhe i thjeshtĂ«. Pas arritjes sĂ« 99,8 % saktĂ«sie, nuk ka asnjĂ« dobi mĂ«. Ka njĂ« garĂ« tĂ« mirĂ« pĂ«r vlerĂ«simin e modeleve tĂ« njohjes — Megaface, nĂ« tĂ« cilĂ«n gradualisht arritĂ«m deri nĂ« 82 % rang 1. Testi Megaface pĂ«rmban njĂ« milion fotografi — distraktues, — dhe modeli duhet tĂ« jetĂ« nĂ« gjendje tĂ« dallojĂ« mirĂ« disa mijĂ«ra fotografi tĂ« famshĂ«m nga dataset-i Facescrub nga distraktuesit. MegjithatĂ«, pasi pastruam testin Megaface nga gabimet, zbuluam se nĂ« versionin e pastĂ«r arrijmĂ« njĂ« saktĂ«si prej 98 % rang 1 (fotografitĂ« e famshme janĂ« mjaft specifike). Prandaj, krijuam njĂ« test identifikimi tĂ« veçantĂ«, tĂ« ngjashĂ«m me Megaface, por me fotografi tĂ« njerĂ«zve 'tĂ« zakonshĂ«m'. Pastaj pĂ«rmirĂ«suam saktĂ«sinĂ« e njohjes nĂ« datasetet tona dhe shkuam shumĂ« pĂ«rpara. PĂ«r mĂ« tepĂ«r, ne pĂ«rdorim njĂ« test tĂ« cilĂ«sisĂ« sĂ« grumbullimit, i cili pĂ«rmban disa mijĂ«ra fotografi; ai simuluar etiketimin e fytyrave nĂ« cloud-in e pĂ«rdoruesit. NĂ« kĂ«tĂ« rast, grumbujt janĂ« grupe fytyrash tĂ« ngjashme, pĂ«r secilin person tĂ« njohur. CilĂ«sia e punĂ«s e kemi verifikuar nĂ« grupe reale (tĂ« vĂ«rteta).

Sigurisht, gabimet e njohjes ndodhin me çdo model. Por kĂ«to situata shpesh zgjidhen pĂ«rmes pĂ«rshtatjes delikate tĂ« pragjeve pĂ«r kushte tĂ« caktuara (pĂ«r tĂ« gjitha konferencat pĂ«rdorim tĂ« njĂ«jtat pragje, ndĂ«rsa, pĂ«r shembull, pĂ«r SCUD pragjet duhet t’i rrisim shumĂ« pĂ«r tĂ« minimizuar goditjet fals pozitive). Shumica dĂ«rrmuese e vizitorĂ«ve tĂ« konferencave janĂ« njohur siç duhet nga kiosqet tona tĂ« fotos Vision. NdonjĂ«herĂ« ndonjĂ« dikush shihte njĂ« miniaturĂ« tĂ« prerĂ« dhe thoshte: "Sistemi juaj gabonte, nuk jam unĂ«". Pastaj hapnim fotografinĂ« e plotĂ« dhe ishte e qartĂ« se nĂ« foto ishte ky vizitor, vetĂ«m se nuk ishim duke kapur atĂ«, por dikĂ« tjetĂ«r, thjesht ndodhi qĂ« personi u shfaq nĂ« sfond nĂ« zonĂ«n e paqĂ«ndrueshme. PĂ«r mĂ« tepĂ«r, rrjeti nervor shpesh njoh edhe kur njĂ« pjesĂ« e fytyrĂ«s nuk Ă«shtĂ« e dukshme, ose kur personi qĂ«ndron nĂ« profil, madje edhe kur Ă«shtĂ« nĂ« njĂ« kĂ«nd tĂ« vogĂ«l. Sistemi mund tĂ« njohĂ« njĂ« person, edhe nĂ«se fytyra bie nĂ« zonĂ«n e deformimeve optike, le tĂ« themi, gjatĂ« xhirimit me njĂ« objektiv tĂ« gjerĂ«.

1.3. Shembuj testimi në situata të vështira

MĂ« poshtĂ« janĂ« disa shembuj tĂ« punĂ«s sĂ« rrjetit tonĂ« nervor. NĂ« hyrje jepen fotografitĂ«, tĂ« cilat ajo duhet t’i shenjojĂ« me PersonID — njĂ« identifikues unik tĂ« fytyrĂ«s. NĂ«se dy ose mĂ« shumĂ« imazhe kanĂ« tĂ« njĂ«jtin identifikues, atĂ«herĂ« sipas mendimit tĂ« modeleve, nĂ« kĂ«to fotografi paraqitet njĂ« person.

TĂ« theksojmĂ« qĂ« gjatĂ« testimit na janĂ« nĂ« dispozicion parametra dhe pragje tĂ« ndryshme tĂ« modeleve, tĂ« cilat mund t’i pĂ«rshtatim pĂ«r tĂ« arritur rezultatet e dĂ«shiruara. API publike Ă«shtĂ« optimizuar pĂ«r saktĂ«si maksimale nĂ« rastet e zakonshme.

Le të fillojmë me të thjeshtën, njohjen e fytyrës në ball.

Me mjekër, në syze të errëta dhe në profil: situata të vështira për vizionin kompjuterik

Mirë, kjo ishte shumë e lehtë. Le të vështirësojmë detyrën, të shtojmë një mjekër dhe disa vithe.

Me mjekër, në syze të errëta dhe në profil: situata të vështira për vizionin kompjuterik

Dikush do të thoshte se kjo gjithashtu nuk ishte shumë e komplikuar, pasi të dyja rastet fytyra është e dukshme plotësisht, algoritmi ka shumë informacion në lidhje me fytyrën. Mirë, do ta kthejmë Tom Hardyn në profil. Kjo detyrë është shumë më e vështirë dhe për zgjidhjen e saj me një nivel të ulët gabimesh kemi ecur shumë: kemi përzgjedhur mostrat për trajnimin, kemi menduar për arkitekturën e rrjetit nervor, kemi përsosur funksionet e humbjes dhe kemi përmirësuar përpunimin paraprak të fotografive.

Me mjekër, në syze të errëta dhe në profil: situata të vështira për vizionin kompjuterik

Le të vendosim një kapelë mbi të:

Me mjekër, në syze të errëta dhe në profil: situata të vështira për vizionin kompjuterik

Për të thënë të drejtën, kjo është një shembull i një situate veçanërisht të komplikuar, pasi këtu fytyra është shumë e mbuluar, dhe në fotografinë e poshtme ka edhe një hije të thellë që i fsheh sytë. Në jetën reale, njerëzit shpesh ndryshojnë pamjen e tyre me syze të errëta. Të njëjtën gjë do ta bëjmë edhe me Tom.

Me mjekër, në syze të errëta dhe në profil: situata të vështira për vizionin kompjuterik

Mirë, le të provosh disa fotografi nga mosha të ndryshme, dhe këtë herë do të vendosim eksperimentin te një aktor tjetër. Do të marrim një shembull shumë më të komplikuar, kur ndryshimet lidhur me moshën shfaqen veçanërisht qartë. Kjo situatë nuk është ndonjë trillim, ndodh shpesh kur duhet të krahasosh një fotografi në pasaportë me fytyrën e personit që e paraqet. Sepse fotografia e parë në pasaportë vendoset kur pronari është 20 vjeç, dhe deri në 45 vjeç një person mund të transformohet shumë:

Me mjekër, në syze të errëta dhe në profil: situata të vështira për vizionin kompjuterik

Mendoni se specialisti kryesor për misione të pamundura nuk ka ndryshuar shumë me kalimin e moshës? Mendoj se shumë pak njerëz do të ishin në gjendje të bashkonin fotografitë e sipërme dhe ato të poshtme, aq shumë ka ndryshuar djali gjatë këtyre viteve.

Me mjekër, në syze të errëta dhe në profil: situata të vështira për vizionin kompjuterik

Rrjetet nervor përballen me ndryshime pamjeje shumë më shpesh. Për shembull, nganjëherë gratë mund të ndryshojnë shumë pamjen e tyre me ndihmën e grimit:

Me mjekër, në syze të errëta dhe në profil: situata të vështira për vizionin kompjuterik

Tani le të vështirësojmë edhe më shumë detyrën: le të themi se në fotografi të ndryshme janë të mbuluara pjesë të ndryshme të fytyrës. Në këto raste algoritmi nuk mund të krahasojë mostrat në tërësi. Megjithatë, Vision bën mirë me situata të tilla.

Me mjekër, në syze të errëta dhe në profil: situata të vështira për vizionin kompjuterik

Meqenëse, në një fotografi të fytyrave ka shumë, për shembull, në një foto grupi mund të shfaqen më shumë se 100 persona. Kjo është një situatë e vështirë për rrjetet nervor, pasi shumë fytyra mund të ndriçohen ndryshe, dikush është jashtë zonës së fokusit. Megjithatë, nëse fotografia është bërë me një cilesi dhe rezolucion të mjaftueshëm (jo më pak se 75 piksele për katrorin që mbulon fytyrën), Vision do të jetë në gjendje ta identifikojë dhe ta njohë.

Me mjekër, në syze të errëta dhe në profil: situata të vështira për vizionin kompjuterik

Karakteristika e fotografive të raportit dhe imazheve nga kamerat e vëzhgimit është se njerëzit shpesh duken të paqëndrueshëm, sepse ndodhen jashtë zonës së fokusit ose lëvizin në atë moment:

Me mjekër, në syze të errëta dhe në profil: situata të vështira për vizionin kompjuterik

Dhe ndriçimi mund të ndryshojë shumë nga një imazh në një tjetër. Kjo shpesh është një pengesë, pasi shumë algoritma hasin vështirësi të mëdha në përpunimin e saktë të imazheve shumë të errëta dhe shumë të ndritura, për të mos përmendur përputhjen e saktë. Dua të kujtoj se për të arritur një rezultat të tillë, duhet të konfigurohen ndonjëherë pragjet, dhe kjo mundësi nuk është ende e disponueshme publikisht. Të gjithë klientët tanë përdorin të njëjtën rrjetë neuronale, e cila ka pragje të vendosura për shumicën e detyrave praktike.

Me mjekër, në syze të errëta dhe në profil: situata të vështira për vizionin kompjuterik

Recently, we released a new version of the model that accurately recognizes Asian faces. This was previously a significant issue known as "machine learning racism" (or "neural networks"). European and American neural networks were good at recognizing Caucasoid faces, but they struggled significantly with Mongoloid and Negroid faces. It’s likely that the situation was the opposite in China regarding accuracy. The issue lies in the training datasets that reflect the dominant types of faces in each country. However, the situation is changing, and today this problem is not as pressing. Vision has no difficulties recognizing individuals from different races.

Me mjekër, në syze të errëta dhe në profil: situata të vështira për vizionin kompjuterik

Njohja e fytyrave është vetëm një nga shumë aplikimet e teknologjisë tonë; Vision mund të mësohet të njohë çfarëdo. Për shembull, numrat e automjeteve, madje edhe në kushte të vështira për algoritmat: në kënde të mprehta, numra të ndotur dhe të vështirë për t'u lexuar.

Me mjekër, në syze të errëta dhe në profil: situata të vështira për vizionin kompjuterik

2. Shembuj praktikë të përdorimit

2.1. Kontrolli i aksesit fizik: kur dy persona kalojnë me një leje

Me ndihmën e Vision, mund të implementohen sisteme për regjistrimin e ardhjes dhe ikjes së punonjësve. Sistemet tradicionale bazuar në lejet elektronike kanë disavantazhe të dukshme, siç është mundësia që dy persona të kalojnë me një kartë. Sidoqoftë, nëse sistemi i kontrollit të aksesit (SKUD) përmirësohet me Vision, ai do të regjistrojë saktësisht se kush dhe kur erdhi u largua.

2.2. Regjistrimi i kohës së punës

Ky skenar i përdorimit të Vision është ngushtësisht i lidhur me të parin. Nëse sistemi i kontrollet për lejet përmirësohet me shërbimin tonë të njohjes së fytyrave, ai do të jetë në gjendje të regjistrojë jo vetëm shkeljet e rregullave, por gjithashtu të regjistrojë praninë efektive të punonjësve në godinë ose në objekt. Me fjalë të tjera, Vision do të ndihmojë në regjistrimin e saktë të këtyre që erdhën në punë dhe sa herë ata ikën, si dhe ata që mungojnë, edhe nëse kolegët e tyre i ndihmojnë përpara shefave.

2.3. Videoanalitika: gjurmimi i njerëzve dhe siguria

Duke ndjekur njerëzit me ndihmën e Vision, është e mundur të vlerësohet saktësisht frekuenca e zonave tregtare, stacioneve, kalimeve, rrugëve dhe shumë vendeve të tjera publike. Gjurmimi ynë mund të ndihmojë gjithashtu në kontrollin e aksesit, për shembull, në një magazinë ose në hapësira të tjera të rëndësishme shërbimi. Sigurisht, gjurmimi i njerëzve dhe fytyrave ndihmon në zgjidhjen e çështjeve të sigurisë. A keni kapur dikë duke vjedhur në dyqanin tuaj? Shtoni PersonID që Vision ktheu në listën e zezë të softuerit tuaj për videoanalitikën, dhe herën tjetër sistemi do t'ju njoftojë menjëherë nëse ky individ shfaqet përsëri.

2.4. NĂ« tregti

Tregu dhe biznesi i shërbimeve janë të interesuar në njohjen e radhëve. Me ndihmën e Vision, mund të identifikohet se ky nuk është një grumbull i rastësishëm njerëzish, por realisht një radhë dhe të vlerësohet gjatësi e saj. Pastaj, sistemi njofton përgjegjësit për ndodhitë e radhës, për të marrë masat: ose ka një fluks vizitorësh dhe është e nevojshme të thirren punëtorë të tjerë, ose dikush nuk është duke punuar siç duhet.

Një detyrë tjetër interesante është ndarjen e punonjësve të kompanisë nga vizitorët në sallë. Zakonisht sistemi mësohet të ndajë objektet në përputhje me një veshje të caktuar (kod veshjeje) ose me ndonjë shenjë dalluese (shami marke, badge në gjoks, etj.). Kjo ndihmon në vlerësimin e saktë të frekuencës (që punonjësit me praninë e tyre të mos 'fryjnë' statistikat e pranishëmve në sallë).

Me ndihmën e njohjes së fytyrave, mund të vlerësoni gjithashtu audiencën tuaj: cili është niveli i besnikërisë së vizitorëve, pra sa njerëz kthehen në ambientet tuaja dhe me çfarë frekuence. Numëroni se sa vizitorë unik vijnë gjatë muajit. Për të optimizuar shpenzimet për tërheqje e mbajtje, mund të kuptoni ndryshimin e frekuencës në varësi të ditës së javës edhe orës.

Franchizuesit dhe kompanitë në rrjet mund të kërkojnë një vlerësim për cilësinë e branding-ut të pikave të ndryshme të shitjes: praninë e logove, tabelave, posterave, bannerave dhe të tjera.

2.5. NĂ« transport

Një tjetër shembull i sigurimit përmes videoanalitikës është identifikimi i gjërave të braktisura në sallat e aeroportëve ose stacioneve. Vision mund të mësohet për të njohur objekte nga qindra klasa: mobilier, çanta, valixhe, ombrella, lloje të ndryshme veshjesh, shishe dhe shumë të tjera. Nëse sistemi juaj i videoanalitikës zb descubr një objekt të braktisur dhe e njeh atë përmes Vision, ai dërgon një sinjal tek shërbimi i sigurisë. Një detyrë e ngjashme lidhet me identifikimin automatik të situatave të pazakonta në vende publike: dikush ndjehet keq, ose dikush po pi duhan në një vend të ndaluar, ose një person bie në shina, etj. - të gjitha këto modele mund të njihet nga sistemi i videoanalitikës përmes API-së Vision.

2.6. Qarkullimi i dokumenteve

Një tjetër aplikim interesant për të ardhmen që po zhvillojmë tani është njohja e dokumenteve dhe parsyshimi i tyre automatik në bazat e të dhënave. Në vend që të shkruani manualisht (ose akoma më keq, të shkruani me dorë) seri, numra, data lëshimi, numra llogarie, të dhëna bankare, datat dhe vendet e lindjes dhe shumë të dhëna të tjera të formuluara, do të mund të skanoni dokumentet dhe t'i dërgoni ato automatikisht përmes një kanali të sigurt përmes API-së në re, ku sistemi do t'i njohë këto dokumente në fluks, do t'i parser dhe do të kthejë një përgjigje me të dhënat në formatin e nevojshëm për injektimin automatik në bazën e të dhënave. Sot Vision tashmë di të klasifikojë dokumente (përfshirë PDF) - dallon pasaportat, SNILS, INN, dëshmitë e lindjes, të martesës dhe të tjera.

Natyrisht, të gjitha këto situata nuk mund të përpunohen nga rrjeti nervor out-of-the-box. Në çdo rast për çdo klient të veçantë ndërtohet një model i ri, duke marrë parasysh shumë faktorë, nuanca dhe kërkesa, duke zgjedhur datasetet, duke kryer iteracione të trajnimit-testimit-rregullimit.

3. Schema e punës së API-së

«Portat hyrëse» të Vision për përdoruesit janë REST API. Në hyrje, ai mund të pranojë fotografi, skedarë video dhe transmetime nga kamerat e rrjetit (RTSP-flow).

Për të përdorur Vision, duhet regjistroheni në shërbimin Mail.ru Cloud Solutions dhe të merrni token-at e qasjes (client_id + client_secret). Autentifikimi i përdoruesve kryhet sipas protokollit OAuth. Të dhënat origjinale në trupat e kërkesave POST dërgohen në API. Si përgjigje, klienti merr nga API rezultatin e njohjes në formatin JSON, ku përgjigjja është e strukturuar: përmban informacion mbi objektet e gjetura dhe koordinatat e tyre.

Me mjekër, në syze të errëta dhe në profil: situata të vështira për vizionin kompjuterik

Shembulli i përgjigjes

{
   "status":200,
   "body":{
      "objects":[
         {
            "status":0,
            "name":"file_0"
         },
         {
            "status":0,
            "name":"file_2",
            "persons":[
               {
                  "tag":"person9"
                  "coord":[149,60,234,181],
                  "confidence":0.9999,
                  "awesomeness":0.45
               },
               {
                  "tag":"person10"
                  "coord":[159,70,224,171],
                  "confidence":0.9998,
                  "awesomeness":0.32
               }
            ]
         }

         {
            "status":0,
            "name":"file_3",
            "persons":[
               {
               "tag":"person11",
               "coord":[157,60,232,111],
               "aliases":["person12", "person13"]
               "confidence":0.9998,
               "awesomeness":0.32
               }
            ]
         },
         {
            "status":0,
            "name":"file_4",
            "persons":[
               {
               "tag":"undefined"
               "coord":[147,50,222,121],
               "confidence":0.9997,
               "awesomeness":0.26
               }
            ]
         }
      ],
      "aliases_changed":false
   },
   "htmlencoded":false,
   "last_modified":0
}

Në përgjigje ka një parametër interesant awesomeness - kjo është "kryeshtësia" e kushteve në fotografi, me ndihmën e saj ne përzgjedhim fotografinë më të mirë të një fytyre nga një sekuencë. Ne e kemi mësuar rrjetin nervor për të parashikuar probabilitetin që fotografia të marrë like në mediat sociale. Sa më cilësore të jetë fotografia dhe më e buzëqeshur të jetë fytyra, aq më shumë awesomeness.

Në API-në Vision përdoret një koncept i tillë, si space. Ky është një instrument për krijimin e grupeve të ndryshme të fytyrave. Shembuj të spejshave - lista të bardha dhe të zeza, lista të vizitorëve, punonjësve, klientëve, etj. Për çdo token në Vision mund të krijoni deri në 10 spejsa, në çdo spejs mund të ketë deri në 50 mijë PersonID, pra deri në 500 mijë për një token. Në të njëjtën kohë numri i tokenëve për një llogari nuk është i kufizuar.

Sot API mbështet metodat e mëposhtme të identifikimit dhe njohjes:

  • Recognize/Set - identifikimi dhe njohja e fytyrave. Ajo automatikisht i jep PersonID çdo fytyre unike, kthen PersonID dhe koordinatat e fytyrave tĂ« gjetura.
  • Delete - fshirja e njĂ« PersonID tĂ« veçantĂ« nga baza e tĂ« dhĂ«nave tĂ« personave.
  • Truncate - pastrimi i tĂ« gjithĂ« spejsit nga PersonID, e dobishme nĂ«se Ă«shtĂ« pĂ«rdorur si test dhe duhet tĂ« zbrazet baza pĂ«r prodhimin.
  • Detect - identifikimi i objekteve, skenave, numrave tĂ« automjeteve, vendeve tĂ« njohura, radhĂ«ve, etj. Kthen klasĂ«n e objekteve tĂ« gjetura dhe koordinatat e tyre.
  • Detect pĂ«r dokumentet - identifikon lloje specifike dokumentesh nga RF (dallon pasaportĂ«n, SNILS, INN etj.).

Po shpejt do të përfundojmë punën mbi metodat për OCR, përcaktimin e gjinisë, moshës dhe emocioneve, si dhe zgjidhjen e problemeve të merchandising, që do të thotë kontrollin automatizuar të ekspozimit të produkteve në dyqane. Dokumentacionin e plotë për API do ta gjeni këtu: https://mcs.mail.ru/help/vision-api

4. Përfundim

Aktualisht, pĂ«rmes API publik, mund tĂ« qasje nĂ« njohjen e fytyrave nĂ« fotografi dhe video, mbĂ«shtetet identifikimi i objekteve tĂ« ndryshme, numrave tĂ« regjistrimit tĂ« automjeteve, monumenteve, dokumenteve dhe skenave tĂ« tĂ«ra. SkenarĂ«t e pĂ«rdorimit janĂ« tĂ« shumtĂ«. Ejani, testoni shĂ«rbimin tonĂ«, vendosni para tij detyrat mĂ« sfiduese. 5000 transaksionet e para — falas. Ndoshta ai do tĂ« jetĂ« 'pjesa e munguar' pĂ«r projektet tuaja.

Aksesin nĂ« API mund ta merrni menjĂ«herĂ« gjatĂ« regjistrimit dhe lidhjes Vision. TĂ« gjithĂ« pĂ«rdoruesit e Habravit — njĂ« kod promovimi pĂ«r transaksione shtesĂ«. Shkruani nĂ« mesazh adresĂ«n e emailit me tĂ« cilĂ«n keni regjistruar llogarinĂ«!

Burimi: habr.com

Bleni hostim tĂ« besueshĂ«m pĂ«r faqe me mbrojtje nga DDoS, serverĂ« VPS VDS đŸ”„ Bleni hostim tĂ« besueshĂ«m pĂ«r faqe me mbrojtje nga DDoS, serverĂ« VPS VDS | ProHoster