NVIDIA a deschis codul StyleGAN3, sistem de învățare automată pentru sintaxa fețelor.

Compania NVIDIA a publicat codul sursă al StyleGAN3, un sistem de învățare automată bazat pe rețele neuronale generative antagoniste (GAN), destinat sintetizării de imagini realiste ale fețelor umane. Codul este scris în Python folosind framework-ul PyTorch și este distribuit sub licența NVIDIA Source Code License, care impune restricții asupra utilizării în scopuri comerciale.

De asemenea, sunt disponibile pentru descărcare modele pre-antrenate, antrenate pe colecția Flickr-Faces-HQ (FFHQ), care include 70 de mii de imagini PNG de înaltă calitate (1024×1024) ale fețelor umane. În plus, există modele bazate pe colecțiile AFHQv2 (fotografii ale fețelor animalelor) și Metfaces (imagini ale fețelor umane din portrete de artă clasică). Deși dezvoltarea se concentrează pe fețe, sistemul poate fi antrenat pentru a genera orice obiecte, de exemplu, peisaje și automobile. De asemenea, sunt furnizate instrumente pentru autoantrenarea rețelei neuronale pe propriile colecții de imagini. Se necesită una sau mai multe plăci grafice NVIDIA (se recomandă GPU Tesla V100 sau A100), cel puțin 12 GB RAM, PyTorch 1.9 și instrumentele CUDA 11.1+. Pentru a determina natura artificială a fețelor generate, se dezvoltă un detector special.

Sistemul permite sintetizarea unei imagini a unei fețe noi pe baza interpolării caracteristicilor mai multor fețe, combinând trăsăturile acestora, precum și adaptând imaginea finală la vârsta, sexul, lungimea părului, caracterul zâmbetului, forma nasului, culoarea pielii, ochelari, unghiul fotografiei dorit. Generatorul consideră imaginea ca o colecție de stiluri, separând automat detaliile caracteristice (pistrui, păr, ochelari) de atributele generale și de înalt nivel (poziție, sex, schimbări legate de vârstă) și permite combinarea acestora în mod liber prin stabilirea proprietăților dominante prin coeficienți de greutate. Drept rezultat, se generează imagini care nu se deosebesc vizual de fotografiile reale.

NVIDIA a deschis codul StyleGAN3, sistem de învățare automată pentru sintaxa fețelor.

Prima variantă a tehnologiei StyleGAN a fost publicată în 2019, iar în 2020 a fost propusă o versiune îmbunătățită, StyleGAN2, care permite obținerea unei calități mai bune a imaginilor și eliminarea unor artefacte. Totuși, sistemul rămânea static, adică nu permitea obținerea unei animații realiste și a mișcării feței. În dezvoltarea StyleGAN3, obiectivul principal a fost adaptarea tehnologiei pentru utilizarea ei în animație și video.

În StyleGAN3 a fost utilizată o arhitectură reproiectată pentru generarea imaginilor, fără aliasing, și au fost propuse noi scenarii pentru antrenarea rețelei neuronale. Au fost incluse noi utilitare pentru vizualizare interactivă (visualizer.py), analiză (avg_spectra.py) și generare video (gen_video.py). De asemenea, în implementare s-a redus consumul de memorie și s-a accelerat procesul de învățare.

NVIDIA a deschis codul StyleGAN3, sistem de învățare automată pentru sintaxa fețelor.

O caracteristică cheie a arhitecturii StyleGAN3 este trecerea la interpretarea tuturor semnalelor din rețeaua neuronală sub formă de procese continue, ceea ce a permis manipularea detaliilor prin poziții relative, nesubordonate coordonatelor absolute ale pixelilor individuali din imagine, ci ancorate la suprafața obiectelor reprezentate. În StyleGAN și StyleGAN2, ancorarea la pixeli în timpul generării a dus la probleme în vizualizarea dinamică, de exemplu, mișcarea imaginii a avut ca rezultat o nealiniere a detaliilor fine, cum ar fi ridurile și firele de păr, care păreau a se mișca separat de restul feței. În StyleGAN3, aceste probleme au fost rezolvate și tehnologia a devenit potrivită pentru generarea video.

De asemenea, se poate menționa anunțul realizării de către companiile NVIDIA și Microsoft a celei mai mari modele lingvistice MT-NLG bazate pe o rețea neuronală profundă cu arhitectura „transformer”. Modelul cuprinde 530 de miliarde de parametrii, iar pentru antrenare a fost folosit un cluster care conține 4480 GPU (560 DGX A100 cu 8 GPU A100 80GB fiecare). servere Domeniile de aplicare ale modelului includ soluționarea sarcinilor de procesare a informațiilor în limbaj natural, precum prezicerea finalizării unei propoziții nefinalizate, răspunsuri la întrebări, înțelegerea textului citit, formularea concluziilor în limbaj natural și rezolvarea ambiguității semnificației cuvintelor.

NVIDIA a deschis codul StyleGAN3, sistem de învățare automată pentru sintaxa fețelor.


Sursa: opennet.ro
Cumpără un hosting fiabil pentru site-uri cu protecție DDoS, servere VPS VDS 🔥 Cumpără un hosting fiabil pentru site-uri cu protecție DDoS, servere VPS VDS | ProHoster