Artikkel koosneb kahest osast:
- LĂŒhike ĂŒlevaade mĂ”ningatest arhitektuuridest, mis on mĂ”eldud objektide tuvastamiseks piltidel ja piltide segmentimiseks, koos kĂ”ige arusaadavamate linkidega ressurssidele. PĂŒĂŒdsin valida video selgitusi, eelistatavalt vene keeles.
- Teine osa keskendub pĂŒĂŒdele mĂ”ista neuraalvĂ”rkude arhitektuuride arengusuundi. Ja tehnoloogiaid, mis pĂ”hinevad neil.

Joonis 1 â NeuraalvĂ”rkude arhitektuuride mĂ”istmine pole lihtne
KÔik algas sellest, et tegin kaks demonstreerivat rakendust objektide klassifitseerimiseks ja tuvastamiseks Android telefonil:
- , kus andmed töödeldakse serveris ja edastatakse telefonile. Piltide klassifitseerimine (image classification) kolmele karu tĂŒĂŒbile: pruuni, musta ja pehme karu.
- , kus andmed töödeldakse telefonil. Objektide tuvastamine (object detection) kolmele tĂŒĂŒbile: sarapuupĂ€hkel, viigimarjad ja datlid.
Klassifitseerimise, objektide tuvastamise ja . SeetÔttu tekkis vajadus teada saada, millised tehisnÀrvivÔrgud tuvastavad objekte piltidel ja millised suudavad segmentida. Leidsin jÀrgmised arhitektuurid, millel on minu jaoks kÔige arusaadavamad lingid ressurssidele:
- R-CNN arhitektuuride seeria (Rregionid, mis Ckonvolutsioon Nneuraalsete NvĂ”rkude omadused): R-CNN, Fast R-CNN, , . Pildi objekti tuvastamiseks kasutatakse Region Proposal Network (RPN) mehhanismi, mis eraldab piiratud piirkonnad (bounding boxes). Alguses kasutati RPN asemel aeglasemat Selective Search mehhanismi. SeejĂ€rel edastatakse eraldatud piiratud piirkonnad tavapĂ€rasele tehisnĂ€rvivĂ”rgule klassifitseerimiseks. R-CNN arhitektuuris on selged âforâ tsĂŒklid, mis loovad piiratud piirkondade jaoks, kokku kuni 2000 korda lĂ€bi sisemise vĂ”rgu AlexNet. Selgete âforâ tsĂŒklite tĂ”ttu aeglustub piltide töötlemise kiirus. Igakuuselt vĂ€hendatakse selgete tsĂŒklite arvu ja lĂ€bidud ringe sisemise tehisnĂ€rvivĂ”rgu kaudu, samuti tehakse kĂŒmneid teisi muudatusi kiirusete suurendamiseks ja objekti tuvastamise ĂŒlesande asendamiseks objekti segmentimisega Mask R-CNN-s.
- (Yainult Ovaatab Laga Once) â esimene nĂ€rvivĂ”rk, mis tuvastas objekte reaalajas mobiilseadmetes. EripĂ€ra: objektide eristamine ĂŒhe lĂ€bimisega (piisab korraks vaatamisest). See tĂ€hendab, et YOLO arhitektuuris ei ole selgeid 'for' silmuseid, mistĂ”ttu töötab vĂ”rk kiiresti. NĂ€iteks sarnasus: NumPy-s puuduvad ka silmused 'for' maatriksite operatsioonide puhul, kuna neid teostatakse NumPy-s madalamal arhitektuuritasemel C-programmeerimiskeele abil. YOLO kasutab eelmÀÀratud akendega ruudustikku. Selleks, et sama objekti ei tuvastataks korduvalt, kasutatakse akende kattuvuse koefitsienti (IoU, Intersection over Union). See arhitektuur töötab laias vahemikus ja omab kĂ”rget : mudel saab olla Ă”petatud fotodel, kuid töötab hĂ€sti ka joonistatud piltidel.
- (Single Shot MultiBox Detector) â kasutatakse parimaid YOLO arhitektuuri ânippeâ (nt mitte-maximalne mahasurumine) ning lisatakse uusi, et nĂ€rvivĂ”rk töötaks kiiremini ja tĂ€psemalt. EripĂ€ra: objektide eristamine ĂŒhe lĂ€bimise kaudu antud akna ruudustiku (default box) abil pildipĂŒramiidis. PildipĂŒramiid on kodeeritud konvolutsioonitensorites jĂ€rjestikuste konvolutsiooni ja max-poolingu operatsioonide kĂ€igus (max-poolingu operatsiooni puhul vĂ€heneb ruumiline mÔÔde). Nii mÀÀratakse suured kui ka vĂ€ikesed objektid ĂŒhe vĂ”rgu lĂ€bimisega.
- MobileSSD (MobiilneNetV2 + SSD) â kahest nĂ€rvivĂ”rgu arhitektuurist koosnev kombinatsioon. Esimene vĂ”rk töötleb andmeid kiiresti ja suurendab tuvastamise tĂ€psust. MobileNetV2 asendab VGG-16, mida kasutati esialgselt . Teine vĂ”rk SSD mÀÀrab objektide asukoha pildil.
- â vĂ€ga vĂ€ike, kuid tĂ€pne tehisintellekt. Ăksinda ei lahenda see objektide tuvastamise probleemi. Kuid seda saab kasutada erinevate arhitektuuride kombinatsioonis ning mobiilsetes seadmetes. Iseloomulik omadus on see, et andmed kokkusurutakse nelja 1Ă1 konvolutsioonifiltri abil, seejĂ€rel laiendatakse neid nelja 1Ă1 ja nelja 3Ă3 konvolutsioonifiltri abil. Ăhte sellist andmete kokkusurumise ja laiendamise iteratsiooni nimetatakse âFire Moduleâ.
- (Semantilise pildisegmentatsiooni teostamine sĂŒgavate konvolutsioonivĂ”rkudega) â objektide segmentatsioon pildil. Arhitektuuri iseloomustab haruldane (dilated convolution) konvolutsioon, mis sĂ€ilitab ruumilise eraldusvĂ”ime. JĂ€rgneb tulemuste post-protsessing etapp graafilise tĂ”enĂ€osusmudeliga (conditional random field), mis aitab eemaldada vĂ€ikeseid segadusi segmentatsioonis ja parandada segmenteeritud pildi kvaliteeti. Kohutava nime âgraafiline tĂ”enĂ€osusmudelâ taga peitub tavaline Gaussi filter, mis on viie punkti kaupa lĂ€henenud.
- PĂŒĂŒdsin vĂ€lja selgitada, kuidas see töötab (Single-Shot Refinement Neural Network for Object Detja, kuid sain vĂ€he aru.
- Vaatasin ka, kuidas töötab tehnoloogia âtĂ€helepanuâ (attention): , , . TĂ€helepanu arhitektuuri iseloomustab automaatne tĂ€helepanu piirkondade (RoI) esiletĂ”stmine pildil, Rhuvide of Imille vĂ”imaldab nĂ€rvivĂ”rk nimega Attention Unit. TĂ€helepanu piirkonnad sarnanevad piiritletud alade (bounding boxes) mĂ€rkidega, kuid erinevalt neist ei ole nad pildile kinnitatud ja vĂ”ivad omada hĂ€guseid piire. SeejĂ€rel eraldatakse tĂ€helepanu piirkondadest omadused (features), mis âyoni onâ rekurentsvĂ”rkudele, mille arhitektuurid on . RekurentsvĂ”rgud suudavad analĂŒĂŒsida omaduste omavahelisi seoseid jĂ€rjestuses. RekurentsvĂ”rgud on algselt kasutatud tekstide tĂ”lkimiseks teistesse keeltesse, kuid nĂŒĂŒd ka pildist ja .
Nende arhitektuuride uurimise kĂ€igus sain aru, et ma ei saa midagi aru.. Ja asi pole selles, et minu nĂ€rvivĂ”rgul on tĂ€helepanu mehhanismiga probleeme. KĂ”ikide nende arhitektuuride loomine sarnaneb mĂ”ne tohutu hackathoniga, kus autorid vĂ”istlevad hĂ€kkimises. Hack (hĂ€kk) on kiire lahendus keerulisele tarkvarakĂŒsimusele. See tĂ€hendab, et kĂ”igi nende arhitektuuride vahel pole nĂ€htavat ega arusaadavat loogilist seost. KĂ”ike, mis neid ĂŒhendab, peetakse parimateks hĂ€kkideks, mida nad ĂŒksteiselt laenavad, pluss ĂŒhine kĂ”igile (vea tagasikandmine, backpropagation). Ei ! Pole selge, mida muuta ja kuidas olemasolevaid saavutusi optimeerida.
Tulemuseks on see, et hĂ€kkide vahelise loogilise seose puudumise tĂ”ttu on need ÀÀrmiselt raskesti meeldejĂ€tmised ja praktikas rakendatavad. Need on killustatud teadmised. Parimal juhul jÀÀvad meelde mĂ”ned huvitavad ja ootamatud hetked, kuid enamik arusaadust ja arusaamatust kaob mĂ€lust juba paar pĂ€eva pĂ€rast. Oleks hea, kui nĂ€dal pĂ€rast mĂ€letatakse vĂ€hemalt arhitektuuri nime. Ja selle artiklite lugemise ja ĂŒlevaatevideote vaatamise peale on kulutatud mitu tundi ja isegi pĂ€eva tööaega!

Joonis 2 â
Minu isikliku arvamuse kohaselt pĂŒĂŒavad enamik teadusartiklite autoreid teha kĂ”ik, et isegi need killustatud teadmised ei jÀÀks lugejale arusaadavaks. Kuid gerundite kasutamine kĂŒmnes rida koos valemitega, mis on vĂ”etud âlaestâ â see on teema eraldi artikli jaoks (probleem ).
SellepĂ€rast tekkis vajadus sĂŒsteematiseerida teave neuraalvĂ”rkude kohta ja seelĂ€bi parandada arusaamise ja mĂ€letamise kvaliteeti. Seega sai erinevate tehnoloogiate ja kunstlike neuraalvĂ”rkude arhitektuuride analĂŒĂŒsi pĂ”hiteemaks jĂ€rgmine ĂŒlesanne: vĂ€lja selgitada, kuhu see kĂ”ik liigub, mitte millise konkreetse neuraalvĂ”rgu ĂŒlesehitusse.
Kuhu see kÔik liigub. Peamised tulemused:
- MasinĂ”ppe alustestimite arv viimase kahe aasta jooksul . VĂ”imalik pĂ”hjus: âneuraalvĂ”rgud ei ole enam millegi uue sĂŒmboliks.â
- IgaĂŒks saab luua töötava neuraalvĂ”rgu lihtsa ĂŒlesande lahendamiseks. Selleks vĂ”tab ta valmis mudeli âmudelite loomaaedâ (model zoo) ja treenib neuraalvĂ”rgu viimast kihti () valmisteatud andmete pĂ”hjal vĂ”i tasuta .
- Suurte tehisintellekti tootjate loomine modellide loomaaedade (model zoo). Nende abil on vÔimalik kiiresti luua Àrirakendus: TensorFlow'i jaoks, PyTorch'i jaoks, Caffe2 jaoks, Chainer'i jaoks ja .
- Tehisintellekt, mis töötab reaalses ajas (real-time) mobiilseadmetes. 10 kuni 50 kaadrit sekundis.
- Tehisintellekti rakendamine telefonides (TF Lite), brauserites (TF.js) ja (IoT, Iasjade of Tinternet). Eriti telefonides, mis juba toetavad tehisintellekti riistvara tasemel (neuroakseleraatorid).
- âIga seade, rĂ”ivad ja vĂ”ib-olla isegi toit saavad IP-v6 aadressi ja suhtlevad omavahelâ â .
- MasinĂ”ppe publikatsioonide arv on hakanud (kahekordistumine iga kahe aasta tagant) alates 2015. aastast. On ilmne, et on vaja artiklite analĂŒĂŒsimiseks tehisintellekti.
- JĂ€rgmised tehnoloogiad saavad ĂŒha populaarsemaks:
- PyTorch â populaarsus kasvab kiiresti ja nĂ€ib, et see ĂŒletab TensorFlow'd.
- Automaatne hĂŒperparameetrite valik AutoML â populaarsus kasvab aeglaselt.
- TÀpseuse jÀrkjÀrguline vÀhenemine ja arvutuskiirus: , algoritmid , ebatÀpsed (ligikaudsed) arvutused, kvantimine (kui nÀrvivÔrgu kaalu muudetakse tÀisarvudeks ja kvantitakse), nÀrviakseleraatorid.
- TÔlge ja .
- Loomine , nĂŒĂŒd juba reaalajas.
- Peamine DL-is on see, et andmeid on palju, kuid nende kogumine ja tÀhistamine ei ole kerge. SeetÔttu areneb automaatne tÀhistamine () nÀrvivÔrkude jaoks kasutades nÀrvivÔrke.
- NÀrvivÔrkudega on arvutiteadus Àkitselt muutunud eksperimentaalseks teaduseks ja tekkinud on .
- IT-raha ja nÀrvivÔrkude populaarsus ilmusid samaaegselt, kui arvutused muutusid turuvÀÀrtuseks. Majandus on kuldvaluuta-arvutuslikuks muutumas . Vaadake minu artiklitökonofoorikas Ajanadaliselt tekib uus
ML/DL programmeerimise metodoloogia Joonis 3 â ML/DL kui uus programmeerimise metodoloogia

Kuid "neurovÔrkude teooriat" pole nii kunagi tekkinud.
Kuid see ei ilmunud kunagi «neuraalvĂ”rkude teooria», mille vĂ”ivad mĂ”elda ja töötada sĂŒsteemselt. See, mis praegu nimetatakse 'teooriaks', on tegelikult eksperimentaalsed, heuristilised algoritmid.
Lingid minu ja mitte ainult ressurssidele:
- Andmeteaduse uudiskiri. Peamiselt piltide töötlemisest. Kes soovib seda saada, saatke e-kiri (foobar167<гаŃ-гаŃ>gmail<ŃĐŸŃĐșа>com). Linke artiklitele ja videotele saatn kogumise kĂ€igus.
- Ăksikasjalik , mida olen lĂ€binud ja mida sooviksin lĂ€bida.
- , millega tasub alustada tehisnĂ€rvivĂ”rkude Ă”ppimist. Pluss broĆĄĂŒĂŒr .
- , kust igaĂŒks leiab endale midagi huvitavat.
- Eriti kasulikud on olnud videokanalid teadusartiklite analĂŒĂŒsiks andmeteaduse valdkonnas. Leidke need, registreeruge neile ja jagage linke oma kolleegidega ning minuga ka. NĂ€iteks:
- tuntud ka kui astep-by-step juhiste ja avatud lÀhtekoodiga.
AitÀh tÀhelepanu eest!
Allikas: habr.com
