Un gruppo di ricercatori dell'Università di Tel Aviv ha presentato HyperStyle, una versione invertita del sistema di machine learning StyleGAN2 sviluppato da NVIDIA, riprogettato per ricreare parti mancanti durante l'editing di immagini reali. Il codice è scritto in Python utilizzando il framework PyTorch ed è distribuito con licenza MIT.
Se StyleGAN consente di sintetizzare nuovi volti umani dall’aspetto realistico, impostando parametri come età, genere, lunghezza dei capelli, espressione del sorriso, forma del naso, colore della pelle, occhiali e angolazione della foto, HyperStyle offre invece la possibilità di modificare parametri simili su fotografie esistenti, senza alterare le caratteristiche distintive e mantenendo il riconoscimento del volto originale. Ad esempio, tramite HyperStyle è possibile simulare il cambiamento di età di una persona in una foto, cambiare acconciatura, aggiungere occhiali, barba o baffi, trasformare l’immagine in quella di un personaggio di cartone animato o di un dipinto, e rendere l’espressione facciale triste o felice. Inoltre, il sistema può essere addestrato non solo per modificare i volti delle persone, ma anche per oggetti di qualsiasi tipo, come ad esempio la modifica delle immagini di automobili.

Il metodo proposto si concentra sulla risoluzione del problema della ricostruzione delle parti mancanti di un'immagine durante la modifica. Nei metodi precedentemente suggeriti, il compromesso tra ricostruzione e modificabilità veniva affrontato tramite un'ottimizzazione fine del generatore di immagini per sostituire le parti dell'immagine target durante la ricreazione delle aree modificabili originariamente assenti. Un inconveniente di tali approcci è la necessità di un lungo addestramento mirato della rete neurale per ogni immagine.
Il metodo basato sull'algoritmo StyleGAN consente di utilizzare un modello standard, pre-addestrato su collezioni di immagini generali, per generare elementi propri dell'immagine originale con un livello di accuratezza paragonabile agli algoritmi che richiedono un addestramento individuale del modello per ogni immagine. Tra i vantaggi del nuovo metodo si segnala anche la possibilità di modificare le immagini con prestazioni simili a quelle in tempo reale.

Modelli pre-addestrati sono disponibili per volti umani, macchine e animali, basati su collezioni come Flickr-Faces-HQ (FFHQ, 70.000 immagini PNG di volti di alta qualità), Stanford Cars (16.000 immagini di automobili) e AFHQ (foto di animali). È inoltre fornito un toolkit per addestrare i propri modelli, insieme a modelli pre-addestrati dei codificatori e generatori standard utilizzabili. Ad esempio, sono disponibili generatori per creare immagini in stile Toonify, personaggi Pixar, generazione di schizzi e anche per la stilizzazione di principesse dei film Disney.




Fonte: opennet.ru
