Un gruppo di ricercatori dell'Università di Tel Aviv ha presentato HyperStyle, una versione invertita del sistema di machine learning StyleGAN2 sviluppato da NVIDIA, rielaborato per ricreare le parti mancanti durante la modifica di immagini reali. Il codice è scritto in Python utilizzando il framework PyTorch e distribuito con licenza MIT.
Se StyleGAN consente di sintetizzare nuovi volti realistici, impostando parametri come età, sesso, lunghezza dei capelli, tipo di sorriso, forma del naso, colore della pelle, occhiali e angoli della fotografia, HyperStyle offre la possibilità di modificare parametri simili in fotografie già esistenti, senza alterare i tratti distintivi e mantenendo il riconoscimento del volto originale. Ad esempio, tramite HyperStyle è possibile simulare un cambiamento di età di una persona in una fotografia, cambiare pettinatura, aggiungere occhiali, barba o baffi, dare all'immagine l'aspetto di un personaggio animato o di un dipinto, rendere l'espressione facciale triste o felice. Inoltre, il sistema può essere addestrato non solo per modificare volti umani, ma anche per qualsiasi oggetto, ad esempio per modificare immagini di automobili.

Il metodo proposto mira a risolvere il problema della ricostruzione delle parti mancanti dell'immagine durante la modifica. Nei metodi precedentemente proposti, il compromesso tra ricostruzione e modificabilità veniva affrontato tramite il fine-tuning del generatore di immagini per sostituire parti dell'immagine target nella ricreazione delle aree modificabili originariamente assenti. Uno svantaggio di approcci simili è la necessità di un lungo addestramento mirato della rete neurale per ogni immagine.
Il metodo basato sull'algoritmo StyleGAN consente di utilizzare un modello standard, pre-addestrato su collezioni di immagini generali, per generare elementi appartenenti all'immagine originale con un livello di verosimiglianza paragonabile agli algoritmi che richiedono un addestramento individuale del modello per ogni immagine. Tra i vantaggi del nuovo metodo c'è anche la possibilità di modificare le immagini con prestazioni vicine al tempo reale.

Modelli già addestrati sono disponibili per volti umani, automobili e animali sulla base delle collezioni Flickr-Faces-HQ (FFHQ, 70.000 immagini PNG ad alta qualità di volti umani), Stanford Cars (16.000 immagini di automobili) e AFHQ (fotografie di animali). È inoltre fornito un toolkit per addestrare i propri modelli, così come modelli già addestrati pronti all'uso di codificatori e generatori standard. Ad esempio, sono disponibili generatori per creare immagini in stile Toonify, personaggi Pixar, schizzi e persino per stilizzare come le principesse dei cartoni animati Disney.




Fonte: opennet.ru
