L'azienda Stability AI ha pubblicato la seconda edizione del sistema di apprendimento automatico Stable Diffusion, capace di sintetizzare e modificare immagini basate su un modello fornito o descrizioni testuali in linguaggio naturale. Il codice degli strumenti per l'addestramento della rete neurale e la generazione di immagini è scritto in Python utilizzando il framework PyTorch ed è pubblicato sotto licenza MIT. I modelli già addestrati sono resi disponibili con una licenza permissiva Creative ML OpenRAIL-M, che consente l'uso a scopi commerciali. Inoltre, è disponibile un generatore di immagini online in modalità dimostrativa.
Miglioramenti chiave nella nuova edizione di Stable Diffusion:
- È stata creata un nuovo modello di sintesi delle immagini basato su descrizioni testuali — SD2.0-v, che supporta la generazione di immagini con risoluzione 768×768. Il nuovo modello è stato addestrato utilizzando la collezione LAION-5B, che include 5,85 miliardi di immagini con descrizioni testuali. Il modello utilizza lo stesso set di parametri del modello Stable Diffusion 1.5, ma si differenzia per l'adozione di un codificatore totalmente nuovo OpenCLIP-ViT/H, che ha permesso di migliorare significativamente la qualità delle immagini risultanti.

- È stata preparata una versione semplificata di SD2.0-base, addestrata su immagini 256×256 utilizzando un modello classico di previsione del rumore e che supporta la generazione di immagini con risoluzione 512×512.

- È stata fornita la possibilità di utilizzare la tecnologia di super campionamento (Super Resolution) per aumentare la risoluzione dell'immagine originale senza compromettere la qualità, utilizzando algoritmi di scaling spaziale e ricostruzione dei dettagli. Il modello di elaborazione delle immagini fornito (SD20-upscaler) supporta un ingrandimento quadruplicato, consentendo di generare immagini con risoluzione 2048×2048.

- È stato proposto il modello SD2.0-depth2img, che considera la profondità e la disposizione spaziale degli oggetti. Per la valutazione monoculare della profondità si utilizza il sistema MiDaS. Il modello consente di sintetizzare nuove immagini, utilizzando un'altra immagine come template, che possono differire radicalmente dall'originale, ma mantenere la composizione generale e la profondità. Ad esempio, è possibile utilizzare la posa di una persona in una fotografia per formare un altro personaggio nella stessa posa.



- Modificata la versione per la modifica delle immagini — SD 2.0-inpainting, che consente di sostituire e modificare parti dell'immagine utilizzando suggerimenti testuali.

- Ottimizzazione dei modelli per l'utilizzo su sistemi standard con una sola GPU.

Fonte: opennet.ru







