Algoritmet e menaxhuara nga të dhënat, si rrjetet neuronale, kanë pushtuar botën. Zhvillimi i tyre është i motivuar nga disa faktorë, duke përfshirë pajisjet e lira dhe të fuqishme dhe volumin e madh të të dhënave. Rrjetet neuronale aktualisht janë në avangardë për çdo gjë që lidhet me detyrat "kognitives", si identifikimi i imazheve, kuptimi i gjuhës natyrore etj. Por ato nuk duhet të kufizohen në këto detyra. Në këtë material, discutohen metodat e kompresimit të imazheve përmes rrjeteve neuronale, duke përdorur mësimin e mbetur. Qasja e paraqitur në artikull funksionon më shpejt dhe më mirë se kodet standarde. Shembuj, ekuacione dhe, sigurisht, tabela me teste janë në thellësi.
Ky artikull bazohet në punës. Supozohet se jeni të njohur me rrjetet neuronale dhe konceptet e tyre konvolucioni dhe funksioni i humbjes.
Çfarë është kompresimi i imazheve dhe çfarë llojesh ka?
Kompresimi i imazheve është procesi i transformimit të një imazhi në një formë të tillë që zë më pak hapësirë. Ruajtja e thjeshtë e imazheve do të kërkonte shumë hapësirë, prandaj eksistojnë kode si JPEG dhe PNG, që janë të fokusuar në reduktimin e madhësisë së imazhit origjinal.
Si është e njohur, ekzistojnë dy tipe të kompresimit të imazheve: pa humbje dhe me humbje. Siç është e qartë nga emrat, me kompresimin pa humbje mund të rikthehen të dhënat e imazhit origjinal, ndërsa me kompresimin me humbje disa të dhëna humben gjatë kompresimit. Për shembull, JPG është një algoritëm me humbje [shënim i përkthyesit — në përgjithësi, mos harrojmë gjithashtu për JPEG pa humbje], ndërsa PNG është një algoritëm pa humbje.

Krahasimi mes kompresimit pa humbje dhe me humbje
Vini re që në imazhin e djathtë ka shumë artefakte bllokuese. Kjo është informacion i humbur. Pikselët fqinj me ngjyrat e ngjashme shkridhen si një zonë për të kursyer hapësirë, por kështu humbet informacioni në lidhje me pikselët e vërtetë. Sigurisht, algoritmet e aplikuara në kodekët JPEG, PNG etj. janë shumë më komplekse, por ky është një shembull intuitiv i kompresionit me humbje. Kompresimi pa humbje është i mirë, por skedarët e kompresuar pa humbje zënë shumë hapësirë në disk. Ekzistojnë mënyra më efikase për të kompresuar imazhet pa humbur shumë informacion, por ato janë mjaft të ngadalta dhe shumë aplikojnë qasje iteruese. Kjo do të thotë se nuk mund të ekzekutohen paralelisht në disa bërthama të procesorëve qendrorë ose grafikë. Kjo kufizim e bën krejtësisht të papraktikueshme për përdorim të përditshëm.
Hyrja e rrjetit nervor konvolucional
Nëse diçka duhet të llogaritet dhe llogaritjet mund të jenë afrikisht, shtoni . Авторы использовали довольно стандартную сверточную нейронную сеть для улучшения сжатия изображений. Представленный метод не только работает наравне с лучшими решениями (если не лучше), он также может использовать параллельные вычисления, что приводит к резкому увеличению скорости. Причина в том, что сверточные нейронные сети (CNN) очень хороши в извлечении пространственной информации из изображений, которые затем представляются в форме компактнее (например, сохраняются только «важные» биты изображения). Авторы хотели использовать эту возможность CNN, чтобы лучше представлять изображения.
Arkitektura
Авторы предложили двойную сеть. Первая сеть принимает на вход изображение и генерирует компактное представление (ComCNN). Выходные данные этой сети затем обрабатываются стандартным кодеком (например, JPEG). После обработки кодеком изображение передается во вторую сеть, которая «исправляет» изображение из кодека в попытке вернуть исходное изображение. Авторы назвали эту сеть реконструирующей CNN (RecCNN). Подобно GAN обе сети обучаются итеративно.

ComCNN Prezentimi kompakto i transmetohet codec-it standard

RecCNN. Të dhënat e ComCNN shkallëzohen me rritjen dhe transmetohen në RecCNN, e cila do të përpiqet të mësojë mbetjen
Të dhënat e codec-it shkallëzohen me rritjen dhe më pas transmetohen në RecCNN. RecCNN do të përpiqet të prodhojë një imazh që i ngjan origjinalit sa më shumë që të jetë e mundur.

Një framework për kompresimin e imazheve. Co(.) është një algoritëm për kompresimin e imazheve. Autorët kanë aplikuar JPEG, JPEG2000 dhe BPG
Çfarë është mbetja?
Mbetja mund të konsiderohet si një hap pastrimi për "përmirësimin" e imazhit të dekoduar nga codec. Duke poseduar një sasi të madhe "informacioni" për botën, rrjeti nervor mund të marrë vendime kognitive për atë çfarë duhet të rregullohet. Kjo ide bazohet në , për të cilin mund të lexoni detajet .
Funksionet e humbjeve
Dy funksione humbjeje përdoren sepse kemi dy rrjete nervore. E para, ComCNN, është e etiketuar si L1 dhe përcaktohet kështu:

Funksioni i humbjes për ComCNN
Shpjegimi
Ky ekuacion mund të duket i komplikuar, por në të vërtetë është standardi (gabimi mesatar i katrorëve) MSE. ||² nënkupton normën e vektorit që ata përfshijnë.

Barazimi 1.1
Cr përfaqëson daljet e ComCNN. θ nënkupton parametrat e mësueshëm të ComCNN, XK është imazhi hyrës.

Barazimi 1.2
Re() nënkupton RecCNN. Ky barazim thjesht transmeton vlerën e barazimit 1.1 në RecCNN. θ nënkupton parametrat e mësueshëm të RecCNN (kapaku lart nënkupton se parametrat janë të fiksuar).
Kufizimi intuitiv
Barazimi 1.0 do ta detyrojë ComCNN të ndryshojë peshat e tij në mënyrë që pas riprodhimit nga RecCNN, imazhi përfundimtar të duket sa më afër imazhit hyrës. Funksioni i dytë i humbjes së RecCNN përcaktohet kështu:

Barazimi 2.0
Shpjegimi
Sërish funksioni mund të duket i komplikuar, por kjo është kryesisht një funksion standard i humbjes së rrjetit nervor (MSE).

Barazimi 2.1
Co() nënkupton daljen e kodekut, x me kapak lart nënkupton daljen e ComCNN. θ2 është parametrat e mësueshëm të RecCNN, res() përfaqëson thjesht daljen e mbetur të RecCNN. Duhet theksuar se RecCNN mësohet mbi diferencën mes Co() dhe imazhit hyrës, por jo mbi imazhin hyrës.
Kufizimi intuitiv
Ekuacioni 2.0 do të detyrojë RecCNN të ndryshojë peshat e tij në mënyrë që daljet të duken sa më afër imazhit hyrës.
Skema e trajnimit
Modelet trajnohen në mënyrë iteruese, siç është . Peshat e modelit të parë fiksohen ndërsa peshat e modelit të dytë përditësohen, pastaj peshat e modelit të dytë fiksohen ndërsa modeli i parë trajnohet.
Testet
Autoret krahasuan metodën e tyre me metodat ekzistuese, përfshirë kodekët e thjeshtë. Metoda e tyre punon më mirë se të tjerat, duke ruajtur njëkohësisht shpejtësi të lartë në pajisjet e përshtatshme. Për më tepër, autoret u përpoqën të përdorin vetëm një nga dy rrjetet dhe theksuan rënien e performancës.

Krahasimi i indeksit të ngjashmërisë strukturore (SSIM). Vlerat e larta tregojnë ngjashmëri më të mirë me origjinalin. Rezultati i punës së autorëve është theksuar me shkronja të trasha
Përfundimi
Ne kemi shqyrtuar një mënyrë të re për të aplikuar mësimin e thellë për kompresimin e imazheve, duke biseduar për mundësitë e përdorimit të rrjeteve nervore në detyra përtej atyre 'të zakonshme', si klasifikimi i imazheve dhe përpunimi i gjuhës. Ky metodë jo vetëm që përmbush standardet moderne, por gjithashtu lejon përpunimin e imazheve shumë më shpejt.
Të studiuarit e rrjeteve nervore është bërë më e lehtë, pasi posaçërisht për adhuruesit e teknologjisë ne kemi krijuar një kod promocional HABR, që ofron një zbritje shtesë prej 10% mbi zbritjen e shfaqur në banner.
E tjera kurse
Artikuj të rekomanduar
Burimi: habr.com
