NVIDIA hapi kodin StyleGAN3, një sistem mësimi makinerie për sintezën e fytyrave

Kompania NVIDIA publikoi kodet burimore të StyleGAN3, një sistem mësimi makinerie të bazuar në një rrjet nervor gjenerativ-gjykues (GAN), i fokusuar në sintezën e imazheve realiste të fytyrave të njerëzve. Kodi është shkruar në gjuhën Python duke përdorur kornizën PyTorch dhe shpërndahet nën licencën NVIDIA Source Code License, e cila vendos kufizime për përdorimin në qëllime komerciale.

Modelet e trajnuara gjithashtu janë të disponueshme për shkarkim, të trajnuara mbi koleksionin Flickr-Faces-HQ (FFHQ), i cili përfshin 70 mijë imazhe të fytyrave të njerëzve me cilësi të lartë (1024×1024) në formatin PNG. Për më tepër, ka modele të ndërtuara mbi koleksionet AFHQv2 (fotografi të kafshëve) dhe Metfaces (imazhe të fytyrave të njerëzve nga portrete të pikturave klasike). Gjatë zhvillimit, theksi vihet tek fytyrat, por sistemi mund të trajnohet për të gjeneruar objekte të tjera, si peizazhe dhe makina. Gjithashtu ofrohen mjete për trajnim të pavarur të rrjetit nervor mbi koleksionet e veta të imazheve. Për funksionimin kërkohen një ose më shumë karta grafike NVIDIA (të rekomanduara GPU Tesla V100 ose A100), të paktën 12 GB RAM, PyTorch 1.9 dhe mjetet CUDA 11.1+. Për të identifikuar karakterin artificial të fytyrave të marra, po zhvillohet një detektor i veçantë.

Sistemi lejon sintezën e imazhit të një fytyre të re mbi bazën e interpolimit të karakteristikave të disa fytyrave, duke kombinuar tiparet e tyre karakteristike dhe duke përshtatur imazhin përkatës sipas moshës, gjinisë, gjatësi të flokëve, karakterit të buzëqeshjes, formës së hundës, ngjyrës së lëkurës, syzeve, këndit të fotografisë. Gjeneratori e sheh imazhin si një koleksion stilesh, duke ndarë automatikisht detajet karakteristike (pikat e bardha, flokët, syzet) nga atributet e përgjithshme të nivelit të lartë (pozita, gjinia, ndryshimet nga mosha) dhe duke lejuar kombinimin e tyre në një formë të rastësishme duke përcaktuar pronat dominuese përmes koeficientëve të peshës. Si rezultat, krijohen imazhe që duken të pandashme nga fotografitë e vërteta.

NVIDIA hapi kodin StyleGAN3, një sistem mësimi makinerie për sintezën e fytyrave

Versioni e parë e teknologjisë StyleGAN u publikua në vitin 2019, pas së cilës në vitin 2020 u propozuar një redaktim i përmirësuar i StyleGAN2, që lejon arritjen e cilësisë më të mirë të imazheve dhe eleminon disa artefakte. Në këtë mënyrë, sistemi mbeti statik, pra nuk lejonte realizimin e animacioneve realiste dhe lëvizjes së fytyrës. Gjatë zhvillimit të StyleGAN3, qëllimi kryesor ishte adaptimi i teknologjisë për përdorim në animacion dhe video.

Në StyleGAN3 është përdorur një arkitekturë e rregulluar e gjenerimit të imazheve, e cila është çliruar nga aliasingu, dhe janë propozuar skenarë të rinj për trajnimin e rrjetit nervor. Ajo përfshin mjete të reja për vizualizimin interaktiv (visualizer.py), analizën (avg_spectra.py) dhe gjenerimin e videove (gen_video.py). Në realizim është reduktuar edhe konsumi i memories dhe procesi i trajnimit është përshpejtuar.

NVIDIA hapi kodin StyleGAN3, një sistem mësimi makinerie për sintezën e fytyrave

Veçoria kryesore e arkitekturës StyleGAN3 është kalimi në interpretimin e të gjithë sinjaleve në rrjetin nervor në formën e proceseve të vazhdueshme, çka lejon që gjatë formimit të detajeve të manipulohet pozitat relative, të cilat nuk janë lidhur me koordinatat absolute të pikselëve të veçantë në imazhin, por janë lidhur me sipërfaqen e objekteve të pasqyruara. Në StyleGAN dhe StyleGAN2, lidhja me pikselët gjatë gjenerimit shkaktonte probleme gjatë vizualizimit dinamik, për shembull, gjatë lëvizjes së imazhit vërehej mospërputhja e detajeve të vogla, siç janë rrudhat dhe fijet e flokëve, të cilat lëviznin sikur ishin ndarë nga fytyra e tjera. Në StyleGAN3 këto probleme janë zgjidhur dhe teknologjia është e përshtatshme për formimin e videove.

Përveç kësaj, duhet theksuar njoftimi për krijimin e modelit më të madh gjuhësor MT-NLG nga kompanitë NVIDIA dhe Microsoft, i bazuar në një rrjet nervor të thellë me arkitekturën e „transformer”. Modeli përfshin 530 miliard parametra, dhe për trajnimin e tij është përdorur një klaster që përfshin 4480 GPU (560 DGX A100 me 8 GPU A100 80GB çdo njësi). Si fushat e aplikimit të modelit përmenden zgjidhja e detyrave të përpunimit të informacionit në gjuhën natyrore, të tilla si parashikimi i përfundimit të një fraze të papërfunduar, përgjigje në pyetje, kuptimi i lexuarit, formimi i konkluzionëve në gjuhën natyrore dhe analizimi i shumëkuptimshmërisë së fjalëve. serverësh Sistemi i indeksimit të trafikut rrjet Arkime 3.1 është i disponueshëm.

NVIDIA hapi kodin StyleGAN3, një sistem mësimi makinerie për sintezën e fytyrave


Burimi: opennet.ru
Купить надежный хостинг для сайтов с защитой от DDoS, VPS VDS серверы 🔥 Купить надежный хостинг для сайтов с защитой от DDoS, VPS VDS серверы | ProHoster