NVIDIA ha aperto il codice di StyleGAN3, un sistema di apprendimento automatico per la sintesi di volti.

L'azienda NVIDIA ha rilasciato i codici sorgente di StyleGAN3, un sistema di machine learning basato su una rete neurale generativa antagonista (GAN) progettato per sintetizzare immagini realistiche di volti umani. Il codice è scritto in Python utilizzando il framework PyTorch ed è distribuito con la licenza NVIDIA Source Code License, che impone restrizioni sul suo utilizzo a scopi commerciali.

Sono disponibili anche modelli preaddestrati pronti per il download, addestrati su un insieme di dati chiamato Flickr-Faces-HQ (FFHQ), che include 70.000 immagini PNG di volti umani ad alta qualità (1024×1024). Inoltre, ci sono modelli basati su collezioni come AFHQv2 (foto di volti di animali) e Metfaces (immagini di volti umani da ritratti di pittura classica). Durante lo sviluppo, l'accento è posto sui volti, ma il sistema può essere addestrato per generare qualsiasi oggetto, come paesaggi e automobili. Sono forniti anche strumenti per l'autoapprendimento della rete neurale su collezioni di immagini personali. È necessario avere una o più schede grafiche NVIDIA (si consiglia un GPU Tesla V100 o A100), almeno 12 GB di RAM, PyTorch 1.9 e toolkit CUDA 11.1 o superiore. Viene sviluppato un rilevatore speciale per determinare il carattere artificiale dei volti ottenuti.

Il sistema consente di sintetizzare l'immagine di un nuovo volto basandosi sull'interpolazione delle caratteristiche di più volti, combinando tratti distintivi e adattando l'immagine finale all'età, al sesso, alla lunghezza dei capelli, al tipo di sorriso, alla forma del naso, al colore della pelle, agli occhiali e all'angolazione della fotografia desiderati. Il generatore considera l'immagine come una collezione di stili, separando automaticamente i dettagli caratteristici (freckles, capelli, occhiali) dagli attributi generali ad alto livello (posizione, sesso, cambiamenti legati all'età) e consente di combinarli in modo arbitrario definendo le proprietà dominanti tramite coefficienti di peso. Di conseguenza, vengono generate immagini indistinguibili da vere fotografie.

NVIDIA ha aperto il codice di StyleGAN3, un sistema di apprendimento automatico per la sintesi di volti.

La prima versione della tecnologia StyleGAN è stata pubblicata nel 2019, seguita nel 2020 da una versione migliorata, StyleGAN2, che offre una qualità delle immagini superiore e riduce alcuni artefatti. Tuttavia, il sistema rimaneva statico, ovvero non consentiva di ottenere animazioni e movimenti del volto realistici. Con lo sviluppo di StyleGAN3, l'obiettivo principale è stata l'adattamento della tecnologia per applicazioni in animazione e video.

StyleGAN3 utilizza un'architettura di generazione delle immagini rivisitata, priva di aliasing, e propone nuovi scenari di addestramento per la rete neurale. Sono state integrate nuove utilità per la visualizzazione interattiva (visualizer.py), l'analisi (avg_spectra.py) e la generazione di video (gen_video.py). Inoltre, sono stati ridotti i consumi di memoria e accelerato il processo di addestramento.

NVIDIA ha aperto il codice di StyleGAN3, un sistema di apprendimento automatico per la sintesi di volti.

Una delle caratteristiche fondamentali dell'architettura StyleGAN3 è stata la transizione verso l'interpretazione di tutti i segnali nella rete neurale come processi continui. Questo ha permesso di manipolare le posizioni relative durante la formazione dei dettagli, ancorate non alle coordinate assolute dei singoli pixel nell'immagine, ma alla superficie degli oggetti rappresentati. In StyleGAN e StyleGAN2, l'ancoraggio ai pixel durante la generazione portava a problemi nella visualizzazione dinamica; ad esempio, durante il movimento dell'immagine si osservava la disallineamento di piccoli dettagli, come rughe e capelli, che sembravano muoversi separatamente dal resto del volto. In StyleGAN3, questi problemi sono stati risolti e la tecnologia è diventata pienamente adatta per la produzione di video.

Inoltre, si segnala l'annuncio da parte delle aziende NVIDIA e Microsoft della creazione del più grande modello linguistico MT-NLG basato su una rete neurale profonda con architettura 'trasformatore'. Il modello comprende 530 miliardi di parametri e per il suo addestramento è stato utilizzato un cluster di 4480 GPU. server Il DGX A100 con 8 GPU A100 80GB ciascuna è progettato per risolvere compiti di elaborazione del linguaggio naturale, come la previsione del completamento delle frasi, rispondere a domande, comprendere testi, generare output in linguaggio naturale e risolvere ambiguità nel significato delle parole.

NVIDIA ha aperto il codice di StyleGAN3, un sistema di apprendimento automatico per la sintesi di volti.


Fonte: opennet.ru
Acquista hosting affidabile per siti web con protezione DDoS, VPS VDS server 🔥 Acquista hosting affidabile per siti web con protezione DDoS, VPS VDS server | ProHoster