Tehisintellekti kasutamine superkompressiooniks piltide jaoks

Tehisintellekti kasutamine superkompressiooniks piltide jaoks
Andmealgoritmid, nagu nĂ€rvivĂ”rgud, on vallutanud maailma. Nende arengut tingivad mitmed pĂ”hjused, sealhulgas odav ja vĂ”imas riistvara ning tohutud andmemahtud. TĂ€nasel pĂ€eval on nĂ€rvivĂ”rgud esirinnas kĂ”ikides „kognitiivsetes“ ĂŒlesannetes, nagu piltide tuvastamine, looduse keele mĂ”istmine jne. Kuid nende rakendusi ei tohiks piirata ainult sellistele ĂŒlesannetele. Selles artiklis rÀÀgitakse piltide tihendamisest nĂ€rvivĂ”rkude abil, kasutades jÀÀkĂ”pet. Artiklis esitatud lĂ€henemine töötab kiiremini ja paremini kui standardkoodekid. Skeemid, vĂ”rrandid ja loomulikult tabel katse tulemustega jÀÀvad allapoole.

See artikkel pÔhineb sellest töös. Eeldatakse, et olete tuttav nÀrvivÔrkude ja nende mÔistetega konvolutsioon ja kaotuse funktsioon.

Mis on piltide tihendamine ja milliseid tĂŒĂŒpe see sisaldab?

Piltide tihendamine on protsess, mille kÀigus muudetakse pilti nii, et see vÔtaks vÀhem ruumi. Lihtne piltide salvestamine vÔtaks palju ruumi, seetÔttu on olemas koodekid, nagu JPEG ja PNG, mille eesmÀrk on vÀhendada algse pildi suurust.

Nagu teada, on olemas kahte tĂŒĂŒpi pildisurmimist: ilma kaotusteta ja kaotustega. Nimetustest selgub, et kaotusteta surumisel on vĂ”imalik saada originaalpildi andmed tagasi, samas kui kaotustega surumise puhul kaotatakse mĂ”ned andmed surumise kĂ€igus. NĂ€iteks on JPG — kaotustega algoritm [tĂ”lkija mĂ€rkus — Ă€rgem unustageme ka kaotusteta JPEG], samas kui PNG on kaotusteta algoritm.

Tehisintellekti kasutamine superkompressiooniks piltide jaoks
Kaotusteta ja kaotustega surumise vÔrdlus

Pöörake tĂ€helepanu, et paremal pildil on palju plokk-artefakte. See on kadunud teave. Naabrid sarnaste vĂ€rvidega pikslid kokku surutakse ĂŒhe alana ruumi kokkuhoiuks, kuid samas kaotatakse teave tegelike pikslite kohta. Loomulikult on JPEG, PNG jne koodekites rakendatavad algoritmid palju keerukamad, kuid see on hea intuitiivne nĂ€ide kadudega kompressioonist. Kaotusteta kompressioon on hea, kuid kaotusteta kompressitud failid vĂ”tavad palju ruumi kettal. On olemas tĂ”husamaid viise piltide kompressimiseks, kaotamata suurt hulka teavet, kuid need on ĂŒsna aeglased ja paljud kasutavad iteratiivseid lĂ€henemisviise. See tĂ€hendab, et neid ei saa korraga kĂ€ivitada mitmel kesks vĂ”i graafika protsessoril. Selline piirang muudab need igapĂ€evases kasutuses tĂ€iesti kasutuks.

Konvolutsioonilise nÀrvivÔrgu sisend

Kui midagi peab arvutama ja arvutused vĂ”ivad olla ligikaudsed, lisage nĂ€rvivĂ”rk. Autorid kasutasid piltide tihendamise tĂ€iustamiseks ĂŒsna tavalist konvolutsioonilist nĂ€rvivĂ”rku. Esitatud meetod toimib mitte ainult samas ridades parimate lahendustega (kui mitte paremini), vaid suudab samuti kasutada paralleelseid arvutusi, mis viib mĂ€rgatava kiirusetĂ”usuni. PĂ”hjus on selles, et konvolutsioonilised nĂ€rvivĂ”rgud (CNN) on vĂ€ga head ruumilise teabe vĂ€ljavĂ”tmises piltidelt, mis esitatakse seejĂ€rel kompaktsemal kujul (nĂ€iteks sĂ€ilitatakse ainult „olulised” pildi osad). Autorid soovisid seda CNN-i vĂ”imet kasutada, et paremini esitada pilte.

Arhitektuur

Autorid pakkusid vĂ€lja kahekordse vĂ”rgu. Esimene vĂ”rk vĂ”tab sisendiks pildi ja genereerib kompaktse esituse (ComCNN). Selle vĂ”rgu vĂ€ljundit töödeldakse seejĂ€rel tavalise koodekiga (nt JPEG). PĂ€rast koodeki töötlemist edastatakse pilt teise vĂ”rku, mis „parandab” koodekist saadud pilti, pĂŒĂŒdes taastada algse pildi. Autorid nimetasid seda vĂ”rku rekonstrueerivaks CNN-iks (RecCNN). Sarnaselt GAN-iga Ă”pivad mĂ”lemad vĂ”rgud iteratiivselt.

Tehisintellekti kasutamine superkompressiooniks piltide jaoks
ComCNN Kompaktne esitlused edastatakse standardsele koodekile

Tehisintellekti kasutamine superkompressiooniks piltide jaoks
RecCNN. ComCNN vĂ€ljundid skaleeritakse kasvamisega ja edastatakse RecCNN-ile, mis ĂŒritab likvideerida ĂŒlejÀÀnud.

Koodeki vĂ€ljundid skaleeritakse kasvamisega ja seejĂ€rel edastatakse RecCNN-ile. RecCNN pĂŒĂŒab genereerida kujutise, mis sarnaneb originaaliga nii palju kui vĂ”imalik.

Tehisintellekti kasutamine superkompressiooniks piltide jaoks
Pildikompressiooni kaudu ja kogu raamistik. Co(.) on pildikompressiooni algoritm. Autorid rakendasid JPEG, JPEG2000 ja BPG.

Mis on jÀÀk?

JÀÀk vĂ”ib olla post-töötluse samm, et 'parandada' koodekiga dekodeeritud pilti. Suure koguse maailmainformatsiooniga tehisintellekt suudab teha kognitiivseid otsuseid selle kohta, mida parandada. See idee pĂ”hineb jÀÀkĂ”ppel, mille kohta saate lugeda ĂŒksikasju siit.

Kaotusefunktsioonid

Kaks kaotusefunktsiooni on kasutusel, kuna meil on kaks nÀrvivÔrku. Esimene neist, ComCNN, on mÀrgistatud kui L1 ja mÀÀratletakse jÀrgmiselt:

Tehisintellekti kasutamine superkompressiooniks piltide jaoks
ComCNNi kaotusefunktsioon

Selgitus

See valem vĂ”ib tunduda keeruline, kuid tegelikult on see standardne (keskmine ruutviga). MSE. ||ÂČ tĂ€histab vektori normi, mida nad sisaldavad.

Tehisintellekti kasutamine superkompressiooniks piltide jaoks
VÔrrand 1.1

Cr tÀhistab ComCNN-i vÀljundit. Ξ tÀhistab ComCNN-i parameetrite Ôppimist, XK - see on sisendpilt.

Tehisintellekti kasutamine superkompressiooniks piltide jaoks
VÔrrand 1.2

Re() tĂ€hendab RecCNN-i. See vĂ”rrand edastab lihtsalt vĂ”rrandi 1.1 vÀÀrtuse RecCNN-i. Ξ tĂ€histab Ă”pitavaid parameetreid RecCNN-is (ĂŒlemine kattekiht tĂ€hendab, et parameetrid on fikseeritud).

Intuitiivne mÀÀratlemine

VÔrrand 1.0 paneb ComCNN-i muutma oma kaalu selliselt, et pÀrast taastamist RecCNN-i abil nÀeks lÔplik pilt vÀlja vÔimalikult sarnane sisendpildile. Teine kaotusfunktsioon RecCNN-is mÀÀratletakse jÀrgmiselt:

Tehisintellekti kasutamine superkompressiooniks piltide jaoks
VÔrrand 2.0

Selgitus

Taaskord vÔib funktsioon tunduda keeruline, kuid see on suuresti standardne nÀrvivÔrgu kaotusfunktsioon (MSE).

Tehisintellekti kasutamine superkompressiooniks piltide jaoks
VÔrrand 2.1

Co() tĂ€hendab koodeki vĂ€ljundit, x ĂŒlemise kattega tĂ€hendab ComCNN-i vĂ€ljundit. Ξ2 on RecCNN-i Ă”pitavad parameetrid, res() tĂ€hendab lihtsalt RecCNN-i jÀÀk vĂ€ljundit. On vÀÀrt mĂ€rkida, et RecCNN Ă”pitakse Co() ja sisendpildi vahelise erinevuse pĂ”hjal, mitte sisendpildi pĂ”hjal.

Intuitiivne mÀÀratlemine

Valem 2.0 sunnib RecCNN'i muutma oma kaalusid nii, et vÀljund nÀeks vÀlja vÔimalikult sarnane sisendpildiga.

Õppemudel

Mudeleid koolitatakse iteratiivselt, nagu GAN. Esimese mudeli kaalud on fikseeritud, kuni teise mudeli kaalud uuendatakse, seejÀrel fikseeritakse teise mudeli kaalud, kui esimene mudel Ôpib.

Testid

Autorid vĂ”rreldes oma meetodit olemasolevate meetoditega, sealhulgas lihtsalt kodeerijatega. Nende meetod töötab paremini kui teised, sĂ€ilitades samal ajal kĂ”rge kiirus vastavas riistvaras. Lisaks proovisid autorid kasutada ainult ĂŒhte kahest vĂ”rgust ja mĂ€rkisid jĂ”udluse langust.

Tehisintellekti kasutamine superkompressiooniks piltide jaoks
Struktuurse sarnasuse (SSIM) indeksite vÔrdlemine. KÔrged vÀÀrtused viitavad paremale sarnasusele originaaliga. Autorite töö tulemus on vÀlja toodud paksus kirjas.

KokkuvÔte

Oleme uurinud uut sĂŒvaĂ”ppe rakendust piltide tihendamiseks ning arutanud nĂ€rvivĂ”rkude kasutamise vĂ”imalusi ĂŒlesannetes, mis ĂŒletavad tavapĂ€raselt kasutatavaid, nagu nĂ€iteks piltide klassifitseerimine ja keeletöötlus. See meetod mitte ainult ei jÀÀ tĂ€napĂ€evastele nĂ”udmistele alla, vaid vĂ”imaldab ka pilte töödeldes palju kiiremini.

NÀrvivÔrkude uurimine on muutunud lihtsamaks, sest spetsiaalselt hubravchanele oleme loonud sooduskoodi HABR, mis annab tÀiendava 10% allahindluse, lisaks juba bÀnneril nÀidatud soodustusele.

Tehisintellekti kasutamine superkompressiooniks piltide jaoks

Rohkem kursusi

Soovitatud artiklid

Allikas: habr.com

Osta usaldusvÀÀrne veebihosting DDoS kaitsega, VPS VDS serverid đŸ”„ Osta usaldusvÀÀrne veebihosting DDoS kaitsega, VPS VDS serverid | ProHoster