Presentato il sistema di sintesi delle immagini Stable Diffusion 2.0.

L'azienda Stability AI ha pubblicato la seconda edizione del sistema di apprendimento automatico Stable Diffusion, capace di sintetizzare e modificare immagini basate su un modello fornito o descrizioni testuali in linguaggio naturale. Il codice degli strumenti per l'addestramento della rete neurale e la generazione di immagini è scritto in Python utilizzando il framework PyTorch ed è pubblicato sotto licenza MIT. I modelli già addestrati sono resi disponibili con una licenza permissiva Creative ML OpenRAIL-M, che consente l'uso a scopi commerciali. Inoltre, è disponibile un generatore di immagini online in modalità dimostrativa.

Miglioramenti chiave nella nuova edizione di Stable Diffusion:

  • È stata creata un nuovo modello di sintesi delle immagini basato su descrizioni testuali — SD2.0-v, che supporta la generazione di immagini con risoluzione 768×768. Il nuovo modello è stato addestrato utilizzando la collezione LAION-5B, che include 5,85 miliardi di immagini con descrizioni testuali. Il modello utilizza lo stesso set di parametri del modello Stable Diffusion 1.5, ma si differenzia per l'adozione di un codificatore totalmente nuovo OpenCLIP-ViT/H, che ha permesso di migliorare significativamente la qualità delle immagini risultanti.
    Presentato il sistema di sintesi delle immagini Stable Diffusion 2.0.
  • È stata preparata una versione semplificata di SD2.0-base, addestrata su immagini 256×256 utilizzando un modello classico di previsione del rumore e che supporta la generazione di immagini con risoluzione 512×512.
    Presentato il sistema di sintesi delle immagini Stable Diffusion 2.0.
  • È stata fornita la possibilità di utilizzare la tecnologia di super campionamento (Super Resolution) per aumentare la risoluzione dell'immagine originale senza compromettere la qualità, utilizzando algoritmi di scaling spaziale e ricostruzione dei dettagli. Il modello di elaborazione delle immagini fornito (SD20-upscaler) supporta un ingrandimento quadruplicato, consentendo di generare immagini con risoluzione 2048×2048.
    Presentato il sistema di sintesi delle immagini Stable Diffusion 2.0.
  • È stato proposto il modello SD2.0-depth2img, che considera la profondità e la disposizione spaziale degli oggetti. Per la valutazione monoculare della profondità si utilizza il sistema MiDaS. Il modello consente di sintetizzare nuove immagini, utilizzando un'altra immagine come template, che possono differire radicalmente dall'originale, ma mantenere la composizione generale e la profondità. Ad esempio, è possibile utilizzare la posa di una persona in una fotografia per formare un altro personaggio nella stessa posa.
    Presentato il sistema di sintesi delle immagini Stable Diffusion 2.0.
    Presentato il sistema di sintesi delle immagini Stable Diffusion 2.0.
    Presentato il sistema di sintesi delle immagini Stable Diffusion 2.0.
  • Modificata la versione per la modifica delle immagini — SD 2.0-inpainting, che consente di sostituire e modificare parti dell'immagine utilizzando suggerimenti testuali.
    Presentato il sistema di sintesi delle immagini Stable Diffusion 2.0.
  • Ottimizzazione dei modelli per l'utilizzo su sistemi standard con una sola GPU.

Presentato il sistema di sintesi delle immagini Stable Diffusion 2.0.


Fonte: opennet.ru
Acquista hosting affidabile per siti web con protezione DDoS, server VPS VDS 🔥 Acquista hosting affidabile per siti web con protezione DDoS, server VPS VDS | ProHoster