NVIDIA ka hapur kodin e StyleGAN3, një sistem mësimi makine për sintezën e fytyrave.

Kompania NVIDIA publikoi tekstet burimore të StyleGAN3, një sistem të mësimit të makinerisë të bazuar në një rrjet nervor të konkurrencës gjenerative (GAN), i fokusuara në sintezën e imazheve realiste të fytyrave njerëzore. Kodi është shkruar në gjuhën Python me përdorimin e framework-ut PyTorch dhe shpërndahet nën licencën e Kodit Burimor të NVIDIA, e cila vendos kufizime mbi përdorimin në qëllime komerciale.

Modeli tĂ« gatshĂ«m tĂ« trajnuar gjithashtu Ă«shtĂ« nĂ« dispozicion pĂ«r shkarkim, i trajnuar mbi koleksionin Flickr-Faces-HQ (FFHQ), qĂ« pĂ«rfshin 70 mijĂ« imazhe tĂ« fytyrave njerĂ«zore me cilĂ«si tĂ« lartĂ« (1024×1024) PNG. Gjithashtu, ka modele tĂ« ndĂ«rtuara mbi koleksionet AFHQv2 (fotografi tĂ« fytyrave tĂ« kafshĂ«ve) dhe Metfaces (imazhe tĂ« fytyrave njerĂ«zore nga portretet e pikturĂ«s klasike). NĂ« zhvillim, pĂ«rqendrohet te fytyrat, megjithatĂ« sistemi mund tĂ« jetĂ« trajnuar pĂ«r tĂ« gjeneruar çdo objekt, pĂ«r shembull, peizazhe dhe automjete. ShtesĂ«, ofrohen mjete pĂ«r ta trajnuar vetĂ« rrjetin nervor me koleksionet e veta tĂ« imazheve. PĂ«r funksionimin kĂ«rkohet njĂ« ose mĂ« shumĂ« karta grafike NVIDIA (tĂ« rekomanduara GPU Tesla V100 ose A100), tĂ« paktĂ«n 12 GB RAM, PyTorch 1.9 dhe mjetet CUDA 11.1+. NjĂ« detektor i veçantĂ« Ă«shtĂ« nĂ« zhvillim pĂ«r tĂ« pĂ«rcaktuar natyrĂ«n artificiale tĂ« fytyrave tĂ« marra.

Sistemi lejon sintezën e një imazhi të ri të fytyrës përmes interpolimit të karakteristikave të disa fytyrave, duke kombinuar tiparet e tyre dhe duke avancuar imazhin për moshën, gjininë, gjatësinë e flokëve, karakterin e buzëqeshjes, formën e hundës, ngjyrën e lëkurës, syzet, dhe këndin e fotografisë. Gjeneruesi e konsideron imazhin si një koleksion stilesh, e ndan automatikisht detajet karakteristike (shenjëzime, flokë, syze) nga atributet e tjera të nivelit të lartë (pozita, gjini, ndryshime të moshës) dhe lejon kombinimin e tyre në një mënyrë të lirë me përcaktimin e pronave dominuese përmes koeficientëve të peshojës. Si rezultat, gjenerohen imazhe që duken të pa dallueshme nga fotografitë e vërteta.

NVIDIA ka hapur kodin e StyleGAN3, një sistem mësimi makine për sintezën e fytyrave.

Varianti i parë i teknologjisë StyleGAN u publikua në vitin 2019, pas së cilës në vitin 2020 u propozuar një redaktim i përmirësuar StyleGAN2, i cili mundëson përmirësimin e cilësisë së imazheve dhe heqjen e disa artefakteve. Megjithatë, sistemi mbeti statik, dmth nuk mundëson arritjen e animacionit realist dhe lëvizjes së fytyrës. Gjatë zhvillimit të StyleGAN3, qëllimi kryesor ishte adaptimi i teknologjisë për ta aplikuar atë në animacion dhe video.

Në StyleGAN3 u përdor një arkitekturë e ridizajnuar për gjenerimin e imazheve, e cila është e lirë nga aliasingu, dhe u propozuan skenarë të rinj për trajnim të rrjetit nervor. Në përmbajtje përfshihen mjete të reja për vizualizimin interaktiv (visualizer.py), analiza (avg_spectra.py) dhe gjenerimin e videos (gen_video.py). Në realizim, gjithashtu është reduktuar konsumi i memories dhe është përshpejtuar procesi i trajtimit.

NVIDIA ka hapur kodin e StyleGAN3, një sistem mësimi makine për sintezën e fytyrave.

Karakteristika kryesore e arkitekturës StyleGAN3 është kalimi në interpretime të të gjitha sinjaleve në rrjetin nervor në formën e proceseve të vazhdueshme, e cila lejon manipulimin e detajeve duke përfshirë pozitat relative, pa u lidhur me koordinatat absolute të pikselëve të veçantë në imazh, por të ngjitura në sipërfaqen e objekteve të paraqitura. Në StyleGAN dhe StyleGAN2, lidhja me pikselët gjatë gjenerimit shkaktonte probleme në vizualizimin dinamik; për shembull, duke lëvizur imazhin, kishte mosmarrëveshje të detajeve të vogla si rrudhat dhe flokët që lëviznin sikur ishin të ndara nga pjesa tjetër e fytyrës. Në StyleGAN3 këto probleme janë zgjidhur dhe teknologjia është bërë e përshtatshme për formimin e videos.

Për më tepër, mund të theksohet njoftimi për krijimin nga kompanitë NVIDIA dhe Microsoft të modelit më të madh gjuhësor MT-NLG bazuar në një rrjet nervor të thellë me arkitekturën 'transformer'. Modeli pokur peshon 530 miliard parametra, dhe për trajnimin e tij është përdorur një klaster me 4480 GPU (560 DGX A100 me nga 8 GPU A100 80GB secila). Si aplikacione të modelit përmenden zgjidhja e detyrave për përpunimin e informacionit në gjuhën natyrore, si përfundimi i propozimeve të paplota, përgjigjet ndaj pyetjeve, kuptimi i lexuarit, formimi i konkluzioneve në gjuhën natyrore dhe analiza e ambiguitetit të kuptimit të fjalëve. servera DGX A100 me 8 GPU A100 80GB në secilin). Si fusha aplikimi, modeli përmend zgjidhjen e problemeve të përpunimit të informacionit në gjuhën natyrore, të tilla si parashikimi i përfundimit të propozimeve të papërfunduara, përgjigjet në pyetje, kuptimi i leximit, formimi i përfundimeve në gjuhën natyrore dhe zgjidhja e ambiguiteve të kuptimit të fjalëve.

NVIDIA ka hapur kodin e StyleGAN3, një sistem mësimi makine për sintezën e fytyrave.


Burimi: opennet.ru
Bleni hostim tĂ« besueshĂ«m pĂ«r faqe me mbrojtje nga DDoS, serverĂ« VPS VDS đŸ”„ Bleni hostim tĂ« besueshĂ«m pĂ«r faqe me mbrojtje nga DDoS, serverĂ« VPS VDS | ProHoster