Das Bildsynthesesystem Stable Diffusion 2.0 wurde vorgestellt.

Das Unternehmen Stability AI hat die zweite Ausgabe des maschinellen Lernsystems Stable Diffusion veröffentlicht, das in der Lage ist, Bilder basierend auf einem vorgegebenen Muster oder einer Beschreibung in natĂŒrlicher Sprache zu synthetisieren und zu verĂ€ndern. Der Code fĂŒr die Werkzeuge zum Trainieren des neuronalen Netzwerks und zur Bildgenerierung wurde in Python unter Verwendung des PyTorch-Frameworks geschrieben und unter der MIT-Lizenz veröffentlicht. Bereits trainierte Modelle sind unter der permissiven Lizenz Creative ML OpenRAIL-M verfĂŒgbar, die eine kommerzielle Nutzung erlaubt. Außerdem steht ein Online-Bildergenerator zur VerfĂŒgung.

Wesentliche Verbesserungen in der neuen Ausgabe von Stable Diffusion:

  • Ein neues Modell zur Bildsynthese aus Textbeschreibungen wurde entwickelt – SD2.0-v, das die Generierung von Bildern mit einer Auflösung von 768×768 unterstĂŒtzt. Das neue Modell wurde mit einer Sammlung von LAION-5B trainiert, die 5,85 Milliarden Bilder mit Textbeschreibungen umfasst. Das Modell verwendet denselben Parameterensatz wie das Modell Stable Diffusion 1.5, unterscheidet sich aber durch den Wechsel zu einem grundlegend anderen Encoder, OpenCLIP-ViT/H, was eine signifikante Verbesserung der QualitĂ€t der resultierenden Bilder ermöglicht.
    Das Bildsynthesesystem Stable Diffusion 2.0 wurde vorgestellt.
  • Eine vereinfachte Version SD2.0-base wurde erstellt, die auf Bildern mit 256×256 trainiert wurde, unter Verwendung eines klassischen Modells zur GerĂ€uschvorhersage und das die Generierung von Bildern mit einer Auflösung von 512×512 unterstĂŒtzt.
    Das Bildsynthesesystem Stable Diffusion 2.0 wurde vorgestellt.
  • Die Möglichkeit der Verwendung von Super Resolution-Technologie zur Erhöhung der Auflösung des ursprĂŒnglichen Bildes ohne QualitĂ€tsverlust wurde bereitgestellt, unter Verwendung von Algorithmen fĂŒr rĂ€umliches Upscaling und Detailrekonstruktion. Das bereitgestellte Modell zur Bildbearbeitung (SD20-upscaler) unterstĂŒtzt eine vierfache VergrĂ¶ĂŸerung, was die Erstellung von Bildern mit einer Auflösung von 2048×2048 ermöglicht.
    Das Bildsynthesesystem Stable Diffusion 2.0 wurde vorgestellt.
  • Das Modell SD2.0-depth2img wurde vorgeschlagen, das die Tiefe und die rĂ€umliche Anordnung von Objekten berĂŒcksichtigt. FĂŒr die monokulare TiefenschĂ€tzung wird das System MiDaS verwendet. Das Modell ermöglicht die Synthese neuer Bilder unter Verwendung eines anderen Bildes als Vorlage, die sich radikal von dem Original unterscheiden können, jedoch die allgemeine Komposition und Tiefe beibehalten. Beispielsweise kann die Pose einer Person auf einem Foto verwendet werden, um einen anderen Charakter in derselben Pose zu formen.
    Das Bildsynthesesystem Stable Diffusion 2.0 wurde vorgestellt.
    Das Bildsynthesesystem Stable Diffusion 2.0 wurde vorgestellt.
    Das Bildsynthesesystem Stable Diffusion 2.0 wurde vorgestellt.
  • Das Modell zur Bildmodifikation wurde aktualisiert – SD 2.0-inpainting, das es ermöglicht, Teile des Bildes mithilfe von Texteingaben zu ersetzen und zu Ă€ndern.
    Das Bildsynthesesystem Stable Diffusion 2.0 wurde vorgestellt.
  • Die Modelle wurden fĂŒr die Verwendung auf herkömmlichen Systemen mit einer GPU optimiert.

Das Bildsynthesesystem Stable Diffusion 2.0 wurde vorgestellt.


Quelle: opennet.ru
60GB SSD 8Gb DDR4