NVIDIA ettevõte avaldas StyleGAN3 lähtekoodid, mis on masinõppesüsteem, põhinev genereerivatel vastandvõrkudel (GAN), mille eesmärk on sünteesida realistlikke inimeste näo pilte. Kood on kirjutatud Pythonis, kasutades PyTorch raamistiku, ja levitatakse NVIDIA Allika Koodide Litsentsi alusel, mis seab piiranguid kaubanduslikuks kasutamiseks.
Laadimiseks on saadaval ka valmis koolitatud mudelid, mis on koolitatud Flickr-Faces-HQ (FFHQ) kogumil, mis sisaldab 70 000 kvaliteetset (1024×1024) PNG-pilti inimeste nägudest. Lisaks on olemas mudelid, mis põhinevad AFHQv2 (loomade näopildid) ja Metfaces (klassikalise maali portreedest pärit inimeste nägude pildid) kogumitel. Arendamisel keskendutakse nägudele, kuid süsteemi saab koolitada ka teiste objektide genereerimiseks, näiteks maastike ja autode jaoks. Samuti pakutakse tööriistu iseseisvaks tehisnärvivõrgu koolitamiseks oma pildikogumite põhjal. Tööks on vajalik üks või mitu NVIDIA graafikakaarti (soovitatav on GPU Tesla V100 või A100), vähemalt 12 GB RAM-i, PyTorch 1.9 ja CUDA 11.1+ tööriistakomplekt. Tehislikkuse määramiseks genereeritud nägude puhul arendatakse spetsiaalset detektoritehnoloogiat.
Süsteem võimaldab sünteesida uue näo pilti, mille aluseks on mitme näo joonte interpolatsioon, kombineerides nendele omaseid jooni ning kohandades lõpppilti vajaliku vanuse, soo, juuste pikkuse, naeratuse iseloomu, nina kuju, naha värvi, prillide ja foto nurga järgi. Generaator käsitleb pilti stiilide kogumina, lahustab automaatselt iseloomulikud detailid (tedretähed, juuksed, prillid) üldistest kõrgetasemelistest atribuutidest (asend, sugu, vanuse muutused) ning võimaldab neid omavahel vabalt kombineerida, määrates domineerivad omadused kaalu koefitsientide kaudu. Selle tulemusena genereeritakse pildid, mis näevad välja sama ehtsad nagu reaalsete fotode.

StyleGAN tehnoloogia esimene versioon avaldati 2019. aastal, millele järgnes 2020. aastal täiustatud versioon StyleGAN2. See võimaldas paremat pildikvaliteeti ja lahendas mõned artefaktid. Siiski jäi süsteem staatiliseks, st ei võimaldanud saavutada realistlikku animatsiooni ja näo liikumist. StyleGAN3 arendamisel oli peamine eesmärk tehnoloogia kohandamine animatsioonide ja videote loomiseks.
StyleGAN3-s on kasutusel ümber kujundatud pildigeneratsiooni arhitektuur, mis on vaba aliasing'ust, ja uued õppimise stsenaariumid närvivõrgu koolitamiseks. Komplektsusesse on lisatud uued interaktiivsed visualiseerimise (visualizer.py), analüüsi (avg_spectra.py) ja video genereerimise (gen_video.py) tööriistad. Samuti on rakenduses vähendatud mälu tarbimist ja kiirendatud koolitusprotsessi.

StyleGAN3 arhitektuuri peamine omadus on üleminek kõikide signaalide tõlgendamisele närvivõrgus pidevate protsesside vormis. See võimaldab detailide loomisel manipuleerida suhteliste positsioonidega, mis ei ole seotud individuaalsete pikslite absoluutsete koordinaatidega, vaid on kinnitatud kujutatud objektide pinnale. StyleGAN-i ja StyleGAN2 puhul viis pikslite seos genereerimise ajal probleemideni dünaamilises visualiseerimises; näiteks liikuva pildi korral ilmnes väikeste detailide, nagu kortsud ja karvad, kõrvalekalle, mis liikusid justkui eraldi ülejäänud näost. StyleGAN3 on need probleemid lahendanud ja tehnoloogia sobib nüüd video genereerimiseks.
Lisaks võib mainida ettevõtete NVIDIA ja Microsoft poolt loodud suurima keelemudeli MT-NLG tutvustamist, mis põhineb sügaval närvivõrgul "transformer" arhitektuuriga. Mudel katab 530 miljardit parameetrit ja koolitamiseks kasutati 4480 GPU-d (560 serverite DGX A100 koos 8 GPU A100 80GB iga. Mudeli rakenduste hulka kuuluvad loomuliku keele töötlemisega seotud ülesannete lahendamine, näiteks lõpetamata lause lõpetamise ennustamine, küsimustele vastamine, arusaamine loetust, loogiliste järelduste tegemine ja sõnade tähenduse многозначности mõistmine.

Allikas: opennet.ru
