Algoritmet e menaxhuara nga të dhënat, si rrjetet neuronale, kanë pushtuar botën. Zhvillimi i tyre është i motivuar nga disa faktorë, duke përfshirë pajisjet e lira dhe të fuqishme dhe volumin e madh të të dhënave. Rrjetet neuronale aktualisht janë në avangardë për çdo gjë që lidhet me detyrat "kognitives", si identifikimi i imazheve, kuptimi i gjuhës natyrore etj. Por ato nuk duhet të kufizohen në këto detyra. Në këtë material, discutohen metodat e kompresimit të imazheve përmes rrjeteve neuronale, duke përdorur mësimin e mbetur. Qasja e paraqitur në artikull funksionon më shpejt dhe më mirë se kodet standarde. Shembuj, ekuacione dhe, sigurisht, tabela me teste janë në thellësi.
Ky artikull bazohet në punës. Supozohet se jeni të njohur me rrjetet neuronale dhe konceptet e tyre konvolucioni dhe funksioni i humbjes.
ĂfarĂ« Ă«shtĂ« kompresimi i imazheve dhe çfarĂ« llojesh ka?
Kompresimi i imazheve është procesi i transformimit të një imazhi në një formë të tillë që zë më pak hapësirë. Ruajtja e thjeshtë e imazheve do të kërkonte shumë hapësirë, prandaj eksistojnë kode si JPEG dhe PNG, që janë të fokusuar në reduktimin e madhësisë së imazhit origjinal.
Si Ă«shtĂ« e njohur, ekzistojnĂ« dy tipe tĂ« kompresimit tĂ« imazheve: pa humbje dhe me humbje. Siç Ă«shtĂ« e qartĂ« nga emrat, me kompresimin pa humbje mund tĂ« rikthehen tĂ« dhĂ«nat e imazhit origjinal, ndĂ«rsa me kompresimin me humbje disa tĂ« dhĂ«na humben gjatĂ« kompresimit. PĂ«r shembull, JPG Ă«shtĂ« njĂ« algoritĂ«m me humbje [shĂ«nim i pĂ«rkthyesit â nĂ« pĂ«rgjithĂ«si, mos harrojmĂ« gjithashtu pĂ«r JPEG pa humbje], ndĂ«rsa PNG Ă«shtĂ« njĂ« algoritĂ«m pa humbje.

Krahasimi mes kompresimit pa humbje dhe me humbje
Vini re që në imazhin e djathtë ka shumë artefakte bllokuese. Kjo është informacion i humbur. Pikselët fqinj me ngjyrat e ngjashme shkridhen si një zonë për të kursyer hapësirë, por kështu humbet informacioni në lidhje me pikselët e vërtetë. Sigurisht, algoritmet e aplikuara në kodekët JPEG, PNG etj. janë shumë më komplekse, por ky është një shembull intuitiv i kompresionit me humbje. Kompresimi pa humbje është i mirë, por skedarët e kompresuar pa humbje zënë shumë hapësirë në disk. Ekzistojnë mënyra më efikase për të kompresuar imazhet pa humbur shumë informacion, por ato janë mjaft të ngadalta dhe shumë aplikojnë qasje iteruese. Kjo do të thotë se nuk mund të ekzekutohen paralelisht në disa bërthama të procesorëve qendrorë ose grafikë. Kjo kufizim e bën krejtësisht të papraktikueshme për përdorim të përditshëm.
Hyrja e rrjetit nervor konvolucional
Nëse diçka duhet të llogaritet dhe llogaritjet mund të jenë afrikisht, shtoni . Autorët përdorën një rrjet të zakonshëm konvolucional për të përmirësuar kompresimin e imazheve. Metoda e paraqitur jo vetëm që funksionon në nivele të ngjashme me zgjidhjet më të mira (nëse jo më të mira), por gjithashtu mund të përdorë llogaritje paralele, çka çon në një rritje të dukshme të shpejtësisë. Arsyeja është se rrjetet konvolucionale të neuronëve (CNN) janë shumë të mira në nxjerrjen e informacionit hapësinor nga imazhet, të cilat pastaj paraqiten në një formë më të kompaktë (p.sh., vetëm 'biskotat' e rëndësishme të imazhit ruhen). Autorët deshën ta shfrytëzojnë këtë mundësi të CNN për të përfaqësuar më mirë imazhet.
Arkitektura
Autorët propozuan një rrjet të dyfishtë. Rrjeti i parë merr si input një imazh dhe gjeneron një përfaqësim të kompakt (ComCNN). Të dhënat e këtij rrjeti pastaj përpunohen nga një kodek standard (p.sh., JPEG). Pas përpunimit nga kodeku, imazhi kalon në rrjetin e dytë, i cili 'korrigjon' imazhin nga kodeku në përpjekje për të rikthyer imazhin origjinal. Autorët e quajtën këtë rrjet rrjeti rikonstruktiv CNN (RecCNN). Njësoj si GAN, të dy rrjetet trajnohen në mënyrë iteruese.

ComCNN Prezentimi kompakto i transmetohet codec-it standard

RecCNN. Të dhënat e ComCNN shkallëzohen me rritjen dhe transmetohen në RecCNN, e cila do të përpiqet të mësojë mbetjen
Të dhënat e codec-it shkallëzohen me rritjen dhe më pas transmetohen në RecCNN. RecCNN do të përpiqet të prodhojë një imazh që i ngjan origjinalit sa më shumë që të jetë e mundur.

Një framework për kompresimin e imazheve. Co(.) është një algoritëm për kompresimin e imazheve. Autorët kanë aplikuar JPEG, JPEG2000 dhe BPG
ĂfarĂ« Ă«shtĂ« mbetja?
Mbetja mund të konsiderohet si një hap pastrimi për "përmirësimin" e imazhit të dekoduar nga codec. Duke poseduar një sasi të madhe "informacioni" për botën, rrjeti nervor mund të marrë vendime kognitive për atë çfarë duhet të rregullohet. Kjo ide bazohet në , për të cilin mund të lexoni detajet .
Funksionet e humbjeve
Dy funksione humbjeje përdoren sepse kemi dy rrjete nervore. E para, ComCNN, është e etiketuar si L1 dhe përcaktohet kështu:

Funksioni i humbjes për ComCNN
Shpjegimi
Ky ekuacion mund tĂ« duket i komplikuar, por nĂ« tĂ« vĂ«rtetĂ« Ă«shtĂ« standardi (gabimi mesatar i katrorĂ«ve) MSE. ||ÂČ nĂ«nkupton normĂ«n e vektorit qĂ« ata pĂ«rfshijnĂ«.

Barazimi 1.1
Cr përfaqëson daljet e ComCNN. Ξ nënkupton parametrat e mësueshëm të ComCNN, XK është imazhi hyrës.

Barazimi 1.2
Re() nënkupton RecCNN. Ky barazim thjesht transmeton vlerën e barazimit 1.1 në RecCNN. Ξ nënkupton parametrat e mësueshëm të RecCNN (kapaku lart nënkupton se parametrat janë të fiksuar).
Kufizimi intuitiv
Barazimi 1.0 do ta detyrojë ComCNN të ndryshojë peshat e tij në mënyrë që pas riprodhimit nga RecCNN, imazhi përfundimtar të duket sa më afër imazhit hyrës. Funksioni i dytë i humbjes së RecCNN përcaktohet kështu:

Barazimi 2.0
Shpjegimi
Sërish funksioni mund të duket i komplikuar, por kjo është kryesisht një funksion standard i humbjes së rrjetit nervor (MSE).

Barazimi 2.1
Co() nënkupton daljen e kodekut, x me kapak lart nënkupton daljen e ComCNN. Ξ2 është parametrat e mësueshëm të RecCNN, res() përfaqëson thjesht daljen e mbetur të RecCNN. Duhet theksuar se RecCNN mësohet mbi diferencën mes Co() dhe imazhit hyrës, por jo mbi imazhin hyrës.
Kufizimi intuitiv
Ekuacioni 2.0 do të detyrojë RecCNN të ndryshojë peshat e tij në mënyrë që daljet të duken sa më afër imazhit hyrës.
Skema e trajnimit
Modelet trajnohen në mënyrë iteruese, siç është . Peshat e modelit të parë fiksohen ndërsa peshat e modelit të dytë përditësohen, pastaj peshat e modelit të dytë fiksohen ndërsa modeli i parë trajnohet.
Testet
Autoret krahasuan metodën e tyre me metodat ekzistuese, përfshirë kodekët e thjeshtë. Metoda e tyre punon më mirë se të tjerat, duke ruajtur njëkohësisht shpejtësi të lartë në pajisjet e përshtatshme. Për më tepër, autoret u përpoqën të përdorin vetëm një nga dy rrjetet dhe theksuan rënien e performancës.

Krahasimi i indeksit të ngjashmërisë strukturore (SSIM). Vlerat e larta tregojnë ngjashmëri më të mirë me origjinalin. Rezultati i punës së autorëve është theksuar me shkronja të trasha
Përfundimi
Ne kemi shqyrtuar një mënyrë të re për të aplikuar mësimin e thellë për kompresimin e imazheve, duke biseduar për mundësitë e përdorimit të rrjeteve nervore në detyra përtej atyre 'të zakonshme', si klasifikimi i imazheve dhe përpunimi i gjuhës. Ky metodë jo vetëm që përmbush standardet moderne, por gjithashtu lejon përpunimin e imazheve shumë më shpejt.
Të studiuarit e rrjeteve nervore është bërë më e lehtë, pasi posaçërisht për adhuruesit e teknologjisë ne kemi krijuar një kod promocional HABR, që ofron një zbritje shtesë prej 10% mbi zbritjen e shfaqur në banner.
E tjera kurse
Artikuj të rekomanduar
Burimi: habr.com
