Məqalə iki hissədən ibarətdir:
- Şəkildə obyektlərin aşkar edilməsi və şəkillərin seqmentasiyası şəbəkələrinin bəzi arxitekturlarını əhatə edən qısa bir izah, mənə ən aydın resurs bağlantıları ilə. İzahat videolarını seçməyə çalışdım, mümkün qədər rus dilində.
- İkinci hissə neyron şəbəkələrinin arxitekturalarının inkişaf istiqamətini anlamağa çalışmaqla bağlıdır. Və onların əsasındakı texnologiyalar.

Şəkil 1 – Neyron şəbəkələrinin arxitekturalarını anlamaq asan deyil
Hər şey ondan başladı ki, Android telefonunda təsnifat və obyekt aşkar etmə üzrə iki nümayiş tətbiqi etdim:
- , məlumatların serverdə işlənməsi və telefona ötürülməsi ilə. Üç növ ayı şəkillərinin təsnifatı: qəhvəyi, qara və plümo.
- , məlumatların telefonun özündə işlənməsi ilə. Üç növ obyektlərin aşkar edilməsi: fındıq, paxlava və xurma.
Şəkil təsnifatı, şəkil üzərində obyektlərin aşkar edilməsi və arasında fərq var. Buna görə də, şəkillərdə obyektləri aşkar edən və seqmentasiya edə bilən neyron şəbəkələrinin arxitekturlarını öyrənməyə ehtiyac var. Mənə ən aydın resurs bağlantıları olan aşağıdakı arxitektura nümunələrini tapdım:
- R-CNN əsaslı arxitekturalar seriyası (Rbölgələr — TVM üçün ikili icra kodu istehsal edən Fift kitabxanası. Fift Yığmanın tərtibatçısı yoxdur. Bu,konsol xəbərləri / Nşəbəkə strukturunu): R-CNN, Fast R-CNN, NFaster R-CNN , YOLO
- (Yilk Nqiymətən həttagörür Nbir dəfə – real zamanda mobil cihazlarda obyektləri tanıyan ilk neyron şəbəkədir. Fərqli xüsusiyyət: obyektlərin bir keçid zamanı ayrı-seçkilik edilməsi (yalnız bir dəfə baxmaq kifayətdir). Yəni YOLO arxitekturasında açıq dövr ardıcıllığı yoxdur, buna görə də şəbəkə sürətli işləyir. Məsələn, belə bir analoqu: NumPy-də matrislərlə əməliyyatlar zamanı da açıq dövr ardıcıllığı yoxdur; belə ki, NumPy-dakı həyata keçirilmələr daha aşağı səviyyədə C proqramlaşdırma dili ilə həyata keçirilir. YOLO əvvəlcədən müəyyən edilmiş pəncərə şəbəkəsindən istifadə edir. Eyni obyektin dəfələrlə müəyyən edilməməsi üçün pəncərə üst-üstə düşmə əmsalı (IoU, Ikəsişmə over Usendikası). Bu arxitektura geniş bir spektrda işləyir və yüksək : model fotolar üzərində təhsil ala bilər, amma eyni zamanda əl ilə çəkilmiş şəkillərdə də yaxşı işləyir.
- (Stək Sçoxsaylı MultiBox Ddetektor) – ən yaxşı YOLO arxitekturası “hacları” (məsələn, non-maximum suppression) istifadə olunur və yeni əlavə edilir ki, süni intellekt daha sürətli və dəqiq işləsin. Xüsusi xüsusiyyət: obyektləri tək bir keçid ilə təyin etmək üçün verilmiş şəbəkə pəncərələri (default box) vasitəsilə şəkillər piramidası üzərində işləmək. Şəkillər piramidası, ardıcıl konvolusiya və max-pooling əməliyyatlarında konvolusiya tensörlərində kodlanır (max-pooling əməliyyatı zamanı məkan ölçüsü azalır). Bu şəkildə həm böyük, həm də kiçik obyektlər tək bir şəbəkə keçidi ilə müəyyən edilir.
- MobileSSD (MobilNetV2 + SSD) – iki neyron şəbəkəsi arxitekturasının birləşməsidir. Birinci şəbəkə sürətli işləyir və tanıma dəqiqliyini artırır. MobileNetV2 əvvəlcə istifadə olunan VGG-16-nın əvəzinə tətbiq olunur . İkinci şəbəkə SSD şəkil üzərində obyektlərin yerini müəyyən edir.
- – çox kiçik, amma dəqiq bir neyron şəbəkəsidir. Öz başına obyektləri aşkar etmək məsələsini həll etmir. Lakin müxtəlif arxitekturaların birləşməsində istifadə edilə bilər. Mobil cihazlarda da tətbiq oluna bilər. Xüsusi xüsusiyyətləri, əvvəlcə məlumatların dörd 1×1 konvolusiya filtri ilə sıxılmasından sonra dörd 1×1 və dörd 3×3 konvolusiya filtrləri ilə genişlənməsidir. Bir bu cür sıxılma-genişləmə iterasiyası “Fire Module” adlanır.
- (Dərin İdarəedici Şəkil Seqmentasiyası Dərin Konvolusiya Şəbəkələri ilə) – şəkil üzərində obyektləri seqmentasiya edir. Arxitekturanın xüsusi xüsusiyyəti, məkan həllini qoruyan seyreltilmiş (dilated convolution) konvolusiyadır. Daha sonra nəticələrin post-prosessinq mərhələsi, kiçik səsləri seqmentasiyadan aradan qaldırmağa və seqmentasiya olunmuş şəkilin keyfiyyətini artırmağa imkan verən qrafik ehtimal modeli (şərti təsadüfi sahə) istifadə olunur. “Qrafik ehtimal modeli” adından gizlənən adi Gauss filtridir, beş nöqtə ilə yaxınlaşdırılmışdır.
- Nəticə əldə etməyə çalışdım (Tək Pass Düzəlişmüxtəliflik Neyron Şəbəkəsi Obyekti Aşkarlamaılakin az şey başa düşdüm.
- Həmçinin “diqqət” (attention) texnologiyasının necə işlədiyinə baxdım: , , . “Diqqət” arxitekturasının xüsusi xüsusiyyəti, şəkil üzərində yüksək diqqət bölgələrini avtomatik ayırmaqdır (RoI, Rregionlar of IAttention Unit adlanan neyron şəbəkəsi ilə maraqlı bölgələri aşkar etmək. Artan diqqət bölgələri məhdud bölgələrə (bounding boxes) bənzəyir, lakin onlardan fərqli olaraq təsvir üzərində sabitləşməyib və bulanık sərhədlərə malikdir. Sonra diqqət bölgələrindən xüsusiyyətlər (features) çıxarılaraq, bunlar rekurent neyron şəbəkələrinə verilir. . Rekurent neyron şəbəkələri ardıcıllıqda xüsusiyyətlər arasındakı müstəqil əlaqələri analiz edə bilir. Rekurent neyron şəbəkələri əvvəlcə mətnləri digər dillərə tərcümə etmək üçün istifadə olunurdu, indi isə və .
Bu memarlığı öyrənərkən heç nə başa düşmədiyimi anladım.. Məsələ o deyil ki, mənim neyron şəbəkəmin diqqət mexanizmi ilə problemi var. Bütün bu memarların yaradılması böyük bir hackathonu xatırladır, burada müəlliflər hacklarda bir-birinə rəqabət aparır. Hack - çətin bir proqram problemi üçün sürətli bir həll. Yəni, bu memarların heç biri arasında görünən və anlaşılan məntiqi bağ yoxdur. Onları bir araya gətirən bütün bunlar, bəzilərinin bir-birindən aldıkları ən uğurlu hacklər toplusudur, üstəlik, ortaq bir (səhv yayılması, backpropagation). Yoxdur ! Nəyi dəyişmək və olan nailiyyətləri necə optimallaşdırmaq lazım olduğu aydın deyil.
Hacks'lar arasında məntiqi bağlantının olmaması nəticəsində, onları xatırlamaq və praktikada tətbiq etmək çox çətindir. Bu, parçalanmış biliklərdir. Ən yaxşı halda, bir neçə maraqlı və gözlənilməz moment xatırlanır, lakin başa düşülən və başa düşülməyənlərin çoxu artıq bir neçə gün ərzində yaddaşdan silinir. Bir həftə sonra ən azı memarlığın adı xatırlanırsa, bu yaxşıdır. Və məqalələri oxumaq və icmal videolarını izləmək üçün bir neçə saat və hətta gün iş vaxtı sərf olunub!

Şəkil 2 –
Mənim şəxsi fikrimə görə, əksər elmi məqalə müəllifləri oxucunun bu parçalanmış bilikləri başa düşməməsi üçün əllərindən gələni edirlər. Lakin on cümlədən ibarət iştirak dəyəri ilə əhəmiyyətli izahlar vermək - bu ayrıca bir məqalə mövzusudur (problem ).
Bu səbəbdən neyron şəbəkələri haqqında məlumatı sistemləşdirmək və beləliklə, anlama və xatırlama keyfiyyətini artırmaq zərurəti yaranıb. Bunun üçün süni neyron şəbəkələrinin ayrı-ayrı texnologiyaları və memarlarını araşdırmağın əsas məsələsi aşağıdakı oldu: bunun hara tərəf gedəcəyini öyrənmək, hansısa spesifik neyron şəbəkəsinin quruluşuna deyil.
Bütün bunlar nereye gedir. Əsas nəticələr:
- Son iki ildə maşın öyrənməsi sahəsində startapların sayı . Mümkün səbəbi: "neyron şəbəkələr artıq yeni bir şey deyil".
- Hər kəs sadə bir problemi həll etmək üçün işləyən neyron şəbəkəsi yarada bilər. Bunun üçün "model ziyarətgahı" (model zoo) içindən hazır bir modeli götürəcək və neyron şəbəkəsinin son qatını () hazır məlumatlarla və ya pulsuz .
- Böyük neyron şəbəkəsi istehsalçıları "model ziyarətgahları" (model zoo) yaratmağa başladılar. Onların köməyi ilə tez bir kommersiya tətbiqi yaratmaq mümkündür: TensorFlow üçün, PyTorch üçün, Caffe2 üçün, Chainer üçün və .
- Real zamanda çalışan neyron şəbəkələri (real-time) mobil cihazlarda. Saniyədə 10-dan 50-yə qədər çərçivə. Neyron şəbəkələrinin telefonlarda (TF Lite), brauzerlərdə (TF.js) və
- ev əşyalarında internet IThings). Xüsusilə də telefonlarda, hansı ki, artıq "çəki" səviyyəsində neyron şəbəkələrini dəstəkləyirlər (neyroakseleratorlar). of Hər bir cihaz, geyim əşyaları və bəlkə də hətta qida arasında IP-v6 ünvanı olacaq
- və bir-biri ilə ünsiyyət quracaq” – Sebastian Thrun M maşın öyrənmə üzrə nəşrlərin sayının artması .
- (hər iki ildən bir iki dəfə artma) aşmağa başladı. Aydın məsələdir ki, məqalələri analiz edən neyron şəbəkələri lazımdır. – populyarlıq sürətlə artır və görünür TensorFlow-u üstələyir.
- Avtomatik hiperparametrlərin seçimi
- PyTorch AutoML
- – populyarlığı yavaş-yavaş artır. Düzgünlükdə tədricən azalma və hesablama sürətinin artması: bulanık məntiq
- , alqoritmlər , qeyri-dəqiq (təxmini) hesablamalar, kvantlaşdırma (neyron şəbəkəsinin ağırlıqları tam ədədlərə çevrilib kvantlaşdırıldığında), neyroakseleratorlar. , artıq real zamanda.
- müəllifin bu sualın və .
- DL-də əsas məsələ – çox məlumatdır, lakin onu toplamaq və başa düşmək çətindir. Bu səbəbdən neyron şəbəkələri üçün avtonom qeyd etmə ( ) inkişaf edir.
- Neyron şəbəkələri Məlumat Elmləri qəflətənvə
- təkrarlanabilirlik böhranı İT pulları və neyron şəbəkələrinin populyarlığı eyni zamanda meydana gəldi, hesablama bazar dəyəri halına gəldikdə. İqtisadiyyat qızıldan-valyuta halına gəlir qızıl-valyuta-hesablama. .
- ekonofizika və İT pullarının yaranma səbəbi haqqında məqaləmə baxın.Tədricən yeni (Maşın Öyrənmə & Dərin Öyrənmə) meydana çıxır ki, bu da proqramı öyrənilmiş neyron şəbəkə modellərinin toplamı kimi təqdim etmək üzərində qurulub.
Şəkil 3 – ML/DL yeni proqramlaşdırma metodologiyası "neyron şəbəkələrinin nəzəriyyəsi"

hələ də ortaya çıxmayıb ki, sistemli düşünmək və işləmək üçün istifadə olunsun. Hal-hazırda "nəzəriyyə" olaraq adlandırılanlar əslində eksperimental, heuristik alqoritmlərdir.
Mənim və digər resurslara bağlantılar: «nevroşəbəkə nəzəriyyələri», çərçivəsində sistemli düşünmək və işləmək mümkündür. İndi «nəzəriyyə» adlandırılan şey əslində eksperimental, heuristik alqoritmlərdir.
Mənim və yalnız mənim resurslarıma olan linklər:
- Data Science üzrə xəbər bülleteni. Əsasən, şəkillərin işlənməsi haqqında. Almaq istəyənlər e-mail göndərsin (foobar167gmailcom). Məqalə və videoların bağlantılarını material yığdıqca göndərirəm.
- Ümumi , keçdiyim və keçmək istədiyim.
- , neyron şəbəkələri öyrənməyə başlamaq üçün başlayacağınız yerlərdir. Üstəlik broşura .
- , burada hər kəs özünə maraqlı bir şey tapacaq.
- Son dərəcə faydalı oldu elmi məqalələrin təhlili üzrə video kanallar Data Science. Tapın, onlara abunə olun və bağlantıları həmkarlarınıza və mənə də göndərin. Nümunələr:
- aka addım-addım təlimatlarla və açıq mənbə kodu ilə.
Diqqətiniz üçün təşəkkür edirəm!
Mənbə: habr.com
