Zespół badaczy z Uniwersytetu Telawiwskiego zaprezentował HyperStyle, odwróconą wersję systemu uczenia maszynowego StyleGAN2 opracowywanego przez firmę NVIDIA, przekształconą do rekonstrukcji brakujących części podczas edytowania rzeczywistych obrazów. Kod napisano w języku Python z wykorzystaniem frameworka PyTorch i jest udostępniany na licencji MIT.
Podczas gdy StyleGAN pozwala na syntetyzowanie realistycznie wyglądających nowych twarzy, określając takie parametry, jak wiek, płeć, długość włosów, kształt uśmiechu, kształt nosa, kolor skóry, okulary oraz kąt zdjęcia, HyperStyle umożliwia zmianę podobnych parametrów na już istniejących fotografiach, nie zmieniając ich cech charakterystycznych i zachowując rozpoznawalność oryginalnej twarzy. Na przykład, za pomocą HyperStyle można symulować zmianę wieku osoby na zdjęciu, zmienić fryzurę, dodać okulary, brodę lub wąsy, nadać obrazowi wygląd postaci z kreskówki lub malowanej ilustracji, sprawić, że wyraz twarzy będzie smutny lub wesoły. System może być również trenowany nie tylko do zmiany twarzy, ale i dowolnych obiektów, na przykład do edytowania obrazów samochodów.

Proponowana metoda ma na celu rozwiązanie problemu rekonstrukcji brakujących części obrazu podczas edytowania. W wcześniej proponowanych metodach kompromis między rekonstrukcją a edytowalnością był osiągany poprzez drobne dostosowanie generatora obrazów do wstawiania części docelowego obrazu podczas rekonstrukcji pierwotnie brakujących edytowalnych obszarów. Wadą takich podejść jest konieczność przeprowadzenia długotrwałego treningu sieci neuronowej dla każdego obrazu.
Metoda oparta na algorytmie StyleGAN umożliwia wykorzystanie typowego modelu, wcześniej wytrenowanego na ogólnych zbiorach obrazów, do generowania elementów charakterystycznych dla oryginalnego obrazu z poziomem wiarygodności porównywalnym z algorytmami wymagającymi indywidualnego treningu modelu dla każdego obrazu. Zaletą nowej metody jest również możliwość modyfikowania obrazów z wydajnością zbliżoną do trybu rzeczywistego.

Gotowe, wytrenowane modele są dostępne dla ludzkich twarzy, samochodów i zwierząt na podstawie zbiorów Flickr-Faces-HQ (FFHQ, 70 tysięcy wysokiej jakości obrazów PNG ludzi), Stanford Cars (16 tysięcy zdjęć samochodów) i AFHQ (zdjęcia zwierząt). Dodatkowo dostępne są narzędzia do trenowania własnych modeli, a także gotowe, wytrenowane modele typowych kodowników i generatorów, które można z nimi wykorzystać. Na przykład dostępne są generatory do tworzenia obrazków w stylu Toonify, postaci Pixara, szkiców oraz do stylizacji na księżniczki z filmów Disneya.




Źródło: opennet.ru
