HyperStyle — Anpassung des maschinellen Lernsystems StyleGAN zur Bearbeitung von Bildern

Eine Forschergruppe der UniversitÀt Tel Aviv hat HyperStyle vorgestellt, eine umgekehrte Variante des von NVIDIA entwickelten maschinellen Lernsystems StyleGAN2, das umgebaut wurde, um fehlende Teile beim Bearbeiten realer Bilder zu rekonstruieren. Der Code ist in Python geschrieben und verwendet das Framework PyTorch und wird unter der MIT-Lizenz verbreitet.

WĂ€hrend StyleGAN es ermöglicht, realistisch aussehende neue menschliche Gesichter zu synthetisieren, indem Parameter wie Alter, Geschlecht, HaarlĂ€nge, Art des LĂ€chelns, Nasenform, Hautfarbe, Brille und fotografischer Winkel angegeben werden, ermöglicht es HyperStyle, Ă€hnliche Parameter in bereits existierenden Fotografien zu verĂ€ndern, ohne deren charakteristische Merkmale zu Ă€ndern und die Wiedererkennbarkeit des ursprĂŒnglichen Gesichts zu bewahren. Beispielsweise kann man mit HyperStyle eine AltersverĂ€nderung einer Person auf einem Foto simulieren, die Frisur Ă€ndern, eine Brille, einen Bart oder einen Schnurrbart hinzufĂŒgen, das Bild wie einen Cartoon-Charakter oder ein GemĂ€lde aussehen lassen oder den Gesichtsausdruck traurig oder fröhlich gestalten. Das System kann zudem nicht nur zum Ändern menschlicher Gesichter, sondern auch fĂŒr beliebige Objekte, wie zum Beispiel zur Bearbeitung von Bildern von Autos, trainiert werden.

HyperStyle - Anpassung des maschinellen Lernsystems StyleGAN zur Bildbearbeitung

Die vorgeschlagene Methode zielt darauf ab, das Problem der Rekonstruktion fehlender Teile eines Bildes bei der Bearbeitung zu lösen. In frĂŒher vorgeschlagenen Methoden wurde der Kompromiss zwischen Rekonstruktion und Bearbeitbarkeit durch Feinjustierung des Bildgenerator zur EinfĂŒgung von Teilen des Zielbildes wĂ€hrend der Rekonstruktion ursprĂŒnglich fehlender bearbeitbarer Bereiche gelöst. Ein Nachteil solcher AnsĂ€tze ist die Notwendigkeit, eine lange gezielte Schulung des neuronalen Netzwerks fĂŒr jedes Bild durchzufĂŒhren.

Die auf dem StyleGAN-Algorithmus basierende Methode ermöglicht die Verwendung eines typischen Modells, das zuvor auf allgemeinen Bildersammlungen trainiert wurde, zur Erzeugung von Elementen, die dem ursprĂŒnglichen Bild eigen sind, mit einer Genauigkeit, die mit Algorithmen vergleichbar ist, die ein individuelles Training des Modells fĂŒr jedes Bild erfordern. Zu den Vorteilen der neuen Methode zĂ€hlt auch die Möglichkeit, Bilder mit einer Leistung zu modifizieren, die nahezu in Echtzeit vergleichbar ist.

HyperStyle - Anpassung des maschinellen Lernsystems StyleGAN zur Bildbearbeitung

Fertige, trainierte Modelle wurden basierend auf den Sammlungen Flickr-Faces-HQ (FFHQ, 70.000 hochqualitative PNG-Bilder von Gesichtern), Stanford Cars (16.000 Bilder von Autos) und AFHQ (Tierfotos) fĂŒr Gesichter von Menschen, Autos und Tieren vorbereitet. ZusĂ€tzlich wurde ein Werkzeug bereitgestellt, um eigene Modelle zu trainieren, sowie gebrauchsfertige vortrainierte Modelle typischer Kodierer und Generatoren. Beispielsweise sind Generatoren verfĂŒgbar, um Bilder im Toonify-Stil, Charaktere von Pixar, die Erstellung von Skizzen und sogar die Stilisation von Disney-Prinzessinnen zu erzeugen.

HyperStyle - Anpassung des maschinellen Lernsystems StyleGAN zur Bildbearbeitung
HyperStyle - Anpassung des maschinellen Lernsystems StyleGAN zur Bildbearbeitung
HyperStyle - Anpassung des maschinellen Lernsystems StyleGAN zur Bildbearbeitung
HyperStyle - Anpassung des maschinellen Lernsystems StyleGAN zur Bildbearbeitung


Quelle: opennet.ru
60GB SSD 8Gb DDR4