Artikulli ndahet në dy pjesë:
- Një përshkrim i shkurtër i disa arkitekturave të rrjetit për identifikimin e objekteve në imazh dhe segmentimin e imazheve me lidhjet më të qarta që njoh. Mundohesha të zgjidhja video shpjeguese dhe preferoja ato në gjuhën shqipe.
- Pjesa e dytë është një përpjekje për të kuptuar drejtimin e zhvillimit të arkitekturave të rrjeteve nervore dhe teknologjive mbi bazën e tyre.

FigurĂ« 1 â Nuk Ă«shtĂ« e lehtĂ« tĂ« kuptosh arkitekturat e rrjeteve nervore
Të gjitha filluan kur krijova dy aplikacione demonstrative për klasifikimin dhe identifikimin e objekteve në telefonin Android:
- , kur të dhënat procesohen në server dhe dërgohen në telefon. Klasifikimi i imazheve (image classification) të tre llojeve të ariut: ari i kaltër, ari i zi dhe ari mbushës.
- , kur të dhënat procesohen në telefonin e vet. Identifikimi i objekteve (object detection) të tre llojeve: filix, fiku dhe datelina.
Ka një ndryshim midis detyrave të klasifikimit të imazheve, identifikimit të objekteve në imazh dhe . Prandaj, u shfaq nevoja për të kuptuar cilat arkitektura të rrjeteve nervore zbulonin objekte në imazhe dhe cilat mund të segmentejnë ato. Gjeta këto shembuj arkitekturash me lidhje më të qarta për mua:
- Seria e arkitekturave të bazuara në R-CNN (Rregjione me Ckonvolucion Nrrjete nervore): R-CNN, Fast R-CNN, NFaster R-CNN , . Për zbulimin e objekteve në imazhe, mekanizmi Region Proposal Network (RPN) identifikon rajone të kufizuara (bounding boxes). Në fillim, për zbulim është përdorur një mekanizëm më i ngadaltë, Selective Search. Pas kësaj, rajonet e kufizuara të identifikuara kalojnë nëpër një rrjet neural të zakonshëm për klasifikim. Në arkitekturën R-CNN ka cikle të qarta 'for' që kalojnë përmes rajoneve të kufizuara, duke arritur deri në 2000 kalime përmes rrjetit të brendshëm AlexNet. Për shkak të cikleve të qarta 'for', shpejtësia e përpunimit të imazheve ngadalësohet. Numri i cikleve të qarta, kalimeve përmes rrjetit neural të brendshëm, zvogëlohet me çdo version të ri të arkitekturës, si dhe bëhen dhjetëra ndryshime të tjera për të rritur shpejtësinë dhe për të zëvendësuar detyrën e zbulimit të objekteve me segmentimin e objekteve në Mask R-CNN.
- (YqĂ« Oduhet LtĂ« Once) â rrjeta e parĂ« nervore qĂ« njohu objekte nĂ« kohĂ« reale nĂ« pajisjet celulare. Karakteristika dalluese: dallimi i objekteve pas njĂ« kalimi (mjafton tĂ« shikosh njĂ« herĂ«). Pra, nĂ« arkitekturĂ«n YOLO nuk ka cikle tĂ« qarta "for", pĂ«r shkak tĂ« sĂ« cilĂ«s rrjeta punon shpejt. PĂ«r shembull, Ă«shtĂ« si analogjia qĂ« nĂ« NumPy, gjatĂ« operacioneve me matrica, gjithashtu nuk ka cikle tĂ« qarta "for", tĂ« cilat nĂ« NumPy realizohen nĂ« nivele mĂ« tĂ« ulta arkitekture pĂ«rmes gjuhĂ«s sĂ« programimit C. YOLO pĂ«rdor njĂ« grilĂ« me dritare tĂ« paracaktuara. PĂ«r tĂ« shmangur identifikimin e tĂ« njĂ«jtit objekt disa herĂ«, pĂ«rdoret coefficienti i mbivendosur tĂ« dritareve (IoU, Intersection over Union). Kjo arkitekturĂ« punon nĂ« njĂ« gamĂ« tĂ« gjerĂ« dhe ka : modeli mund tĂ« trajnohet nĂ« fotografi, por megjithatĂ« punon mirĂ« nĂ« piktura tĂ« vizatuara.
- (Single Shot MultiBox DPërdoren trikimet më të dobishme të arkitekturës YOLO (për shembull, non-maximum suppression) dhe shtohen të reja, për të punuar më shpejt dhe saktë me nevrale. Karakteristika dalluese: dallimi i objekteve në një kalim me anë të një rrjeti dritash (default box) në piramidën e imazheve. Piramida e imazheve është koduar në tenzorët konvulutes duke kryer operacione të renditjes dhe pooling (në operacionin max-pooling, dimensioni hapësinor zvogëlohet). Kështu përcaktohen si objektet e mëdha ashtu edhe ato të vogla në një kalim të rrjetit.
- MobileSSD (MobileNetV2 + SSD) â kombinimi i dy arkitekturave tĂ« rrjeteve nervore. Rrjeti i parĂ« punon shpejt dhe rrit saktĂ«sinĂ« e njohjes. MobileNetV2 pĂ«rdoret nĂ« vend tĂ« VGG-16, e cila u pĂ«rdor fillimisht nĂ« . Rrjeti i dytĂ« SSD pĂ«rcakton pozitat e objekteve nĂ« imazh.
- â njĂ« rrjet neural shumĂ« tĂ« vogĂ«l, por tĂ« saktĂ«. Ai vetĂ« nuk zgjidh problemin e objektit. MegjithatĂ«, mund tĂ« pĂ«rdoret nĂ« kombinim me arkitektura tĂ« ndryshme. Dhe mund tĂ« pĂ«rdoret nĂ« pajisje mobile. Karakteristika dalluese Ă«shtĂ« se fillimisht tĂ« dhĂ«nat kompresohen nĂ« katĂ«r filtra konvolucion 1Ă1, dhe pastaj zgjerohen nĂ« katĂ«r filtra konvolucion 1Ă1 dhe katĂ«r filtra konvolucion 3Ă3. NjĂ« iteracion i tillĂ« i kompresimit dhe zgjerimit tĂ« tĂ« dhĂ«nave quhet «Moduli i Zjarrit».
- (Segmentimi i Imazheve Semantike me Rrjeta Konvencionale tĂ« thella) â segmentimi i objekteve nĂ« njĂ« imazh. Karakteristika dalluese e arkitekturĂ«s Ă«shtĂ« konvolucioni i holluar (dilated convolution), i cili ruan rezolutĂ«n hapĂ«sinore. Pas kĂ«saj, ndodh faza e pĂ«rpunimit post-ekzekutiv tĂ« rezultateve duke pĂ«rdorur njĂ« model probabilistik grafik (conditional random field), qĂ« lejon heqjen e zhurmave tĂ« vogla nĂ« segmentim dhe pĂ«rmirĂ«simin e cilĂ«sisĂ« sĂ« imazhit tĂ« segmentuar. Pas emrit tĂ« fuqishĂ«m «model probabilistik grafik» fshihet njĂ« filtĂ«r i zakonshĂ«m Gauss, i cili Ă«shtĂ« aproksimuar nĂ« bazĂ« tĂ« pesĂ« pikave.
- Përpiqesha të kuptoja mekanizmin (Rrjet Neural i Qëndrueshëm për Objektin në një Gjuajtje Refinement Neural Network for Object Detmënyrës, por nuk kuptova shumë.
- Shikova gjithashtu se si funksionon teknologjia "vëmendje" (attention): , , . Një karakteristikë e veçantë e arkitekturës "vëmendje" është nxjerrja automatikisht e rajoneve me vëmendje të përmirësuar në imazh (RoI, RRajonet of Ie Interesit) përmes një rrjete nervore të quajtur Njësia e Vëmendjes. Rajonet me vëmendje të përmirësuar ngjasojnë me kutitë kufizuese (bounding boxes), por ndryshe nga ato, nuk janë të ngulitura në imazh dhe mund të kenë kufij të paqëndrueshëm. Më pas, nga rajonet me vëmendje të përmirësuar nxirren tiparet (features), të cilat "ushqehën" në rrjetet nervore rekurentë me arkitektura . Rrjetet nervore rekurentë janë të afta të analizojnë marrëdhënien e tipareve në një sekuencë. Rrjetet nervore rekurentë fillimisht u përdorën për përkthimin e teksteve në gjuhë të tjera, tani edhe për përkthimin dhe .
Me kalimin e kohës duke studiuar këto arkitektura kuptova se nuk kuptoj asgjë.. Dhe nuk është se në rrjetin tim nervor ka probleme me mekanizmin e vëmendjes. Krijimi i të gjitha këtyre arkitekturave është si një hackathon i madh, ku autorët garojnë në hacks. Hack (hack) është një zgjidhje e shpejtë për një detyrë të vështirë programore. Pra, mes të gjitha këtyre arkitekturave nuk ka një lidhje të dukshme dhe logjike. E vetmja gjë që i bashkon ato është një grup hacks të suksesshëm që ata huazojnë nga njëri-tjetri, plus një lidhje e përbashkët për të gjithë (përhapja e prapme e gabimeve, backpropagation). Jo ! Nuk është e qartë se çfarë duhet të ndryshohet dhe si të optimizohen arritjet ekzistuese.
Si rezultat i mungesës së lidhjeve logjike mes hacks, ato janë tepër të vështira për t'u mbajtur mend dhe për t'u aplikuar në praktikë. Këto janë njohuri fragmentarike. Në rastin më të mirë, disa momente interesante dhe të papritura mbahen mend, por shumica e asaj që u kuptua dhe nuk u kuptua zhduket nga memoria pas disa ditësh. Do të ishte mirë nëse pas një javë do të kujtohej të paktën emri i arkitekturës. Dhe për të lexuar artikuj dhe për të parë video përmbledhëse u shpenzuan disa orë dhe madje ditë të kohës së punës!

Figura 2 â
SipĂ«rfaqja e artikujve shkencorĂ«, sipas mendimit tim personal, Ă«shtĂ« se shumica e autorĂ«ve pĂ«rpiqen tĂ« bĂ«jnĂ« tĂ« vetĂ«m qĂ« edhe kĂ«to njohuri tĂ« fragmentuara tĂ« mos kuptohen nga lexuesi. Por, ndĂ«rtimet e pjesĂ«ve tĂ« folura nĂ« dhjetĂ« proza me formula, tĂ« marra 'nga tavani' â ky Ă«shtĂ« njĂ« temĂ« pĂ«r njĂ« artikull tĂ« veçantĂ« (problemi ).
Për këtë arsye, ka lindur nevoja për të sistematizuar informacionin në lidhje me rrjetet nervore dhe, në këtë mënyrë, për të rritur cilësinë e kuptimit dhe memorizimit. Kështu, tema kryesore e shqyrtimit të teknologjive dhe arkitekturave të ndryshme të rrjeteve nervore artificiale ishte detyra e mëposhtme: të kuptojmë se ku po shkon gjithçka, dhe jo struktura e ndonjë rrjeti nervor të veçantë.
Ku po shkon gjithçka. Rezultatet kryesore:
- Numri i startupeve në fushën e mësimit mbështetës në dy vitet e fundit . Shkaku i mundshëm: 'rrjetet nervore kanë ndaluar së qeni diçka e re'.
- Ădo kush mund tĂ« krijojĂ« njĂ« rrjet nervor funksional pĂ«r tĂ« zgjidhur njĂ« detyrĂ« tĂ« thjeshtĂ«. PĂ«r kĂ«tĂ«, do tĂ« marrĂ« njĂ« model tĂ« gatshĂ«m nga 'zoo e modeleve' (model zoo) dhe do tĂ« stĂ«rvisĂ« shtresĂ«n e fundit tĂ« rrjetit nervor () mbi tĂ« dhĂ«nat e gatshme nga apo nga nĂ« cloudin falas tĂ« .
- Prodhuesit e mëdhenj të rrjeteve nervore filluan të krijojnë «zoo modele» (model zoo). Me anë të tyre mund të krijoni shpejt një aplikacion komercial: për TensorFlow, për PyTorch, për Caffe2, për Chainer dhe .
- Rrjetet nervore që punojnë në kohë reale (real-time) në pajisjet mobile. Nga 10 deri në 50 kadra në sekondë.
- Aplikimi i rrjeteve nervore në telefonat (TF Lite), në shfletues (TF.js) dhe në (IoT, Igjerat of T). Sidomos në telefonat që tashmë mbështesin rrjetet nervore në nivelin e «harduerit» (neuroaccelerators).
- «Ădo pajisje, objekte veshjeje dhe, ndoshta, madje edhe ushqimi do tĂ« kenĂ« adresĂ«n IP-v6 dhe do tĂ« komunikojnĂ« me njĂ«ra-tjetrĂ«n» â .
- Rritja e numrit tĂ« publikimeve pĂ«r mĂ«simin motorik ka filluar (dyfishimi çdo dy vjet) qĂ« nga viti 2015. ĂshtĂ« e qartĂ« se nevojiten rrjete nervore pĂ«r analizĂ«n e artikujve.
- Teknologjitë e mëposhtme po fitojnë popullaritet:
- PyTorch â popullariteti po rritet me shpejtĂ«si dhe, duket se, po kalon TensorFlow.
- Zgjedhja automatike e hiperparametrave AutoML â popullariteti po rritet ngadalĂ«.
- Rënia graduale e saktësisë dhe rritja e shpejtësisë së llogaritjeve: , algoritme , llogaritje të pasakta (afrohet), kvantizimi (kur peshat e rrjetit nervor shndërrohen në numra të plotë dhe kvantizohen), neuroakseleratorët.
- Përkthim dhe .
- Krijimi , tani tashmë në kohë reale.
- Pika kryesore në DL është se ka shumë të dhëna, por mbledhja dhe etiketimi i tyre nuk është e lehtë. Prandaj zhvillohet automatizimi i etiketimit () për rrjetet nervore me ndihmën e rrjeteve nervore.
- Me rrjetet nervore, Shkenca Kompjuterike papritur u bë shkencë eksperimentale dhe ndodhi .
- Paratë në IT dhe popullariteti i rrjeteve nervore u shfaqën njëkohësisht, kur llogaritjet u bënë një vlerë tregu. Ekonomia nga valuta e arit bëhet arit-valutë-llogaritëse.Shihni artikullin tim mbi dhe arsyen e shfaqjes së parave IT.
Gradualisht po shfaqet një (Mësimi i Makinerive & Mësimi i Thellë), e cila bazohet në përfaqësimin e programit si një bashkësi modelesh të trajnuara të rrjetit nervor.

Figura 3 â ML/DL si njĂ« metodologji e re programimi
Megjithatë, nuk ka ardhur akoma «teoritë e rrjeteve nervore», në kuadër të cilit mund të mendoni dhe punoni sistematikisht. Ajo që tani quhet «teori» në të vërtetë janë algoritme eksperimentale dhe heuristike.
Lidhje për burimet e mia dhe jo vetëm:
- Njoftime pĂ«r lajmet nĂ« Data Science. Kryesisht pĂ«r pĂ«rpunimin e imazheve. Kush dĂ«shiron tâi marrĂ«, le tĂ« dĂ«rgojĂ« e-mail (foobar167<gaff-gaff>gmail<dot>com). Lidhjet pĂ«r artikuj dhe video i dĂ«rgoj sipas grumbullimit tĂ« materialeve.
- Lista e përgjithshme , të cilat kam ndjekur dhe do të donja të ndiqja.
- , me të cilat ia vlen të filloni të studioni rrjetet nervore. Plus broshurën .
- , ku secili do të gjejë diçka interesante për vete.
- Janë treguar ekstremisht të dobishme kanalet video që analizojnë artikuj shkencorë në Data Science. Gjeni, abonohuni tek ata dhe dërgoni lidhje kolegëve të tu dhe mua gjithashtu. Shembuj:
- aka me udhëzime hap pas hapi dhe kod të hapur.
Faleminderit për vëmendjen!
Burimi: habr.com
