L'azienda Stability AI ha pubblicato la seconda edizione del sistema di apprendimento automatico Stable Diffusion, in grado di sintetizzare e modificare immagini basate su un modello proposto o una descrizione testuale in linguaggio naturale. Il codice degli strumenti per l'addestramento della rete neurale e la generazione di immagini è scritto in Python utilizzando il framework PyTorch ed è pubblicato sotto licenza MIT. I modelli già addestrati sono aperti sotto una licenza permissiva Creative ML OpenRAIL-M, che consente l'uso a scopi commerciali. È inoltre disponibile un generatore di immagini online in demo.
Miglioramenti chiave nella nuova edizione di Stable Diffusion:
- È stata creata una nuova modello di sintesi delle immagini da descrizione testuale — SD2.0-v, che supporta la generazione di immagini con risoluzione 768×768. Il nuovo modello è stato addestrato utilizzando la collezione LAION-5B, che include 5,85 miliardi di immagini con descrizioni testuali. Il modello utilizza lo stesso set di parametri del modello Stable Diffusion 1.5, ma si distingue per il passaggio all'uso di un codificatore OpenCLIP-ViT/H completamente diverso, che ha permesso di migliorare notevolmente la qualità delle immagini risultanti.

- È stata preparata una versione semplificata SD2.0-base, addestrata su immagini 256×256 utilizzando il classico modello di previsione del rumore e che supporta la generazione di immagini con risoluzione 512×512.

- È stata fornita la possibilità di utilizzare la tecnologia di supercampionamento (Super Resolution) per aumentare la risoluzione dell'immagine di partenza senza perdere qualità, utilizzando algoritmi di scalatura spaziale e ricostruzione dei dettagli. Il modello di elaborazione delle immagini fornito (SD20-upscaler) supporta un ingrandimento quattro volte, consentendo di creare immagini con risoluzione 2048×2048.

- È stato proposto il modello SD2.0-depth2img, che tiene conto della profondità e della disposizione spaziale degli oggetti. Per la stima della profondità monoculare viene utilizzato il sistema MiDaS. Il modello consente di sintetizzare nuove immagini utilizzando un'altra immagine come modello, che può differire radicalmente dall'originale, ma mantenendo la composizione e la profondità complessive. Ad esempio, è possibile utilizzare la posa di una persona in una foto per creare un altro personaggio nella stessa posa.



- Modello aggiornato per la modifica delle immagini — SD 2.0-inpainting, che consente di sostituire e modificare parti dell’immagine utilizzando suggerimenti testuali.

- Ottimizzazione dei modelli per l'uso su sistemi comuni con una sola GPU.

Fonte: opennet.ru







