Un grup de cercetători de la Universitatea din Tel Aviv a prezentat HyperStyle, o variantă inversată a sistemului de învățare automată StyleGAN2 dezvoltat de compania NVIDIA, care a fost reproiectată pentru a recrea părțile lipsă în editarea imaginilor reale. Codul este scris în Python folosind cadrul PyTorch și este distribuit sub licența MIT.
Dacă StyleGAN permite sintetizarea de fețe umane realiste prin specificarea unor parametri precum vârsta, sexul, lungimea părului, caracterul zâmbetului, forma nasului, culoarea pielii, ochelarii și unghiul fotografiei, atunci HyperStyle oferă posibilitatea de a modifica parametrii similari în fotografii deja existente, fără a schimba caracteristicile distinctive și păstrând recunoașterea feței originale. De exemplu, cu ajutorul HyperStyle se poate simula schimbarea vârstei unei persoane din fotografie, se poate schimba coafura, se pot adăuga ochelari, barbă sau mustață, se poate conferi imaginii aspectul unui personaj de desen animat sau al unei lucrări artistice, sau se poate face expresia feței tristă sau fericită. În plus, sistemul poate fi antrenat nu doar pentru modificarea fețelor umane, ci și pentru orice obiecte, de exemplu, pentru editarea imaginilor cu automobile.

Metoda propusă vizează soluționarea problemei reconstructării părților lipsă ale imaginii în timpul editării. În metodele propuse anterior, compromisurile între reconstrucție și editabilitate au fost rezolvate prin ajustarea fină a generatorului de imagini pentru a înlocui părțile imaginii țintă la recrearea zonelor editabile inițial lipsă. O problemă a acestor abordări este necesitatea antrenării îndelungate a rețelei neuronale pentru fiecare imagine.
Metoda bazată pe algoritmul StyleGAN permite utilizarea unui model standard, antrenat anterior pe colecții comune de imagini, pentru generarea elementelor caracteristice ale imaginii originale cu un nivel de credibilitate comparabil cu algoritmii care necesită antrenarea individuală a modelului pentru fiecare imagine. De asemenea, se remarcă printre avantajele noii metode posibilitatea de a modifica imaginile cu o performanță apropiată de timpul real.

Modele deja antrenate sunt pregătite pentru fețele oamenilor, mașinilor și animalelor, bazate pe colecțiile Flickr-Faces-HQ (FFHQ, 70.000 de imagini PNG de înaltă calitate ale fețelor umane), Stanford Cars (16.000 de imagini ale mașinilor) și AFHQ (fotografii cu animale). De asemenea, uneltele pentru antrenarea propriilor modele sunt disponibile, alături de modele antrenate gata de utilizare, tipice pentru codificatori și generatoare. De exemplu, sunt disponibile generatoare pentru a crea imagini în stil Toonify, personaje Pixar, schițe și chiar pentru stilizarea după prințese din desenele animate Disney.




Sursa: opennet.ro
