Kompania NVIDIA publikoi kodet burimore të StyleGAN3, një sistem mësimi makinerie të bazuar në një rrjet nervor gjenerativ-gjykues (GAN), i fokusuar në sintezën e imazheve realiste të fytyrave të njerëzve. Kodi është shkruar në gjuhën Python duke përdorur kornizën PyTorch dhe shpërndahet nën licencën NVIDIA Source Code License, e cila vendos kufizime për përdorimin në qëllime komerciale.
Modelet e trajnuara gjithashtu janĂ« tĂ« disponueshme pĂ«r shkarkim, tĂ« trajnuara mbi koleksionin Flickr-Faces-HQ (FFHQ), i cili pĂ«rfshin 70 mijĂ« imazhe tĂ« fytyrave tĂ« njerĂ«zve me cilĂ«si tĂ« lartĂ« (1024Ă1024) nĂ« formatin PNG. PĂ«r mĂ« tepĂ«r, ka modele tĂ« ndĂ«rtuara mbi koleksionet AFHQv2 (fotografi tĂ« kafshĂ«ve) dhe Metfaces (imazhe tĂ« fytyrave tĂ« njerĂ«zve nga portrete tĂ« pikturave klasike). GjatĂ« zhvillimit, theksi vihet tek fytyrat, por sistemi mund tĂ« trajnohet pĂ«r tĂ« gjeneruar objekte tĂ« tjera, si peizazhe dhe makina. Gjithashtu ofrohen mjete pĂ«r trajnim tĂ« pavarur tĂ« rrjetit nervor mbi koleksionet e veta tĂ« imazheve. PĂ«r funksionimin kĂ«rkohen njĂ« ose mĂ« shumĂ« karta grafike NVIDIA (tĂ« rekomanduara GPU Tesla V100 ose A100), tĂ« paktĂ«n 12 GB RAM, PyTorch 1.9 dhe mjetet CUDA 11.1+. PĂ«r tĂ« identifikuar karakterin artificial tĂ« fytyrave tĂ« marra, po zhvillohet njĂ« detektor i veçantĂ«.
Sistemi lejon sintezën e imazhit të një fytyre të re mbi bazën e interpolimit të karakteristikave të disa fytyrave, duke kombinuar tiparet e tyre karakteristike dhe duke përshtatur imazhin përkatës sipas moshës, gjinisë, gjatësi të flokëve, karakterit të buzëqeshjes, formës së hundës, ngjyrës së lëkurës, syzeve, këndit të fotografisë. Gjeneratori e sheh imazhin si një koleksion stilesh, duke ndarë automatikisht detajet karakteristike (pikat e bardha, flokët, syzet) nga atributet e përgjithshme të nivelit të lartë (pozita, gjinia, ndryshimet nga mosha) dhe duke lejuar kombinimin e tyre në një formë të rastësishme duke përcaktuar pronat dominuese përmes koeficientëve të peshës. Si rezultat, krijohen imazhe që duken të pandashme nga fotografitë e vërteta.

Versioni e parë e teknologjisë StyleGAN u publikua në vitin 2019, pas së cilës në vitin 2020 u propozuar një redaktim i përmirësuar i StyleGAN2, që lejon arritjen e cilësisë më të mirë të imazheve dhe eleminon disa artefakte. Në këtë mënyrë, sistemi mbeti statik, pra nuk lejonte realizimin e animacioneve realiste dhe lëvizjes së fytyrës. Gjatë zhvillimit të StyleGAN3, qëllimi kryesor ishte adaptimi i teknologjisë për përdorim në animacion dhe video.
Në StyleGAN3 është përdorur një arkitekturë e rregulluar e gjenerimit të imazheve, e cila është çliruar nga aliasingu, dhe janë propozuar skenarë të rinj për trajnimin e rrjetit nervor. Ajo përfshin mjete të reja për vizualizimin interaktiv (visualizer.py), analizën (avg_spectra.py) dhe gjenerimin e videove (gen_video.py). Në realizim është reduktuar edhe konsumi i memories dhe procesi i trajnimit është përshpejtuar.

Veçoria kryesore e arkitekturës StyleGAN3 është kalimi në interpretimin e të gjithë sinjaleve në rrjetin nervor në formën e proceseve të vazhdueshme, çka lejon që gjatë formimit të detajeve të manipulohet pozitat relative, të cilat nuk janë lidhur me koordinatat absolute të pikselëve të veçantë në imazhin, por janë lidhur me sipërfaqen e objekteve të pasqyruara. Në StyleGAN dhe StyleGAN2, lidhja me pikselët gjatë gjenerimit shkaktonte probleme gjatë vizualizimit dinamik, për shembull, gjatë lëvizjes së imazhit vërehej mospërputhja e detajeve të vogla, siç janë rrudhat dhe fijet e flokëve, të cilat lëviznin sikur ishin ndarë nga fytyra e tjera. Në StyleGAN3 këto probleme janë zgjidhur dhe teknologjia është e përshtatshme për formimin e videove.
PĂ«rveç kĂ«saj, duhet theksuar njoftimi pĂ«r krijimin e modelit mĂ« tĂ« madh gjuhĂ«sor MT-NLG nga kompanitĂ« NVIDIA dhe Microsoft, i bazuar nĂ« njĂ« rrjet nervor tĂ« thellĂ« me arkitekturĂ«n e âtransformerâ. Modeli pĂ«rfshin 530 miliard parametra, dhe pĂ«r trajnimin e tij Ă«shtĂ« pĂ«rdorur njĂ« klaster qĂ« pĂ«rfshin 4480 GPU (560 DGX A100 me 8 GPU A100 80GB çdo njĂ«si). Si fushat e aplikimit tĂ« modelit pĂ«rmenden zgjidhja e detyrave tĂ« pĂ«rpunimit tĂ« informacionit nĂ« gjuhĂ«n natyrore, tĂ« tilla si parashikimi i pĂ«rfundimit tĂ« njĂ« fraze tĂ« papĂ«rfunduar, pĂ«rgjigje nĂ« pyetje, kuptimi i lexuarit, formimi i konkluzionĂ«ve nĂ« gjuhĂ«n natyrore dhe analizimi i shumĂ«kuptimshmĂ«risĂ« sĂ« fjalĂ«ve. serverĂ«sh Sistemi i indeksimit tĂ« trafikut rrjet Arkime 3.1 Ă«shtĂ« i disponueshĂ«m.

Burimi: opennet.ru
