Został zaprezentowany system syntezy obrazów Stable Diffusion 2.0

Firma Stability AI opublikowała drugą edycję systemu uczenia maszynowego Stable Diffusion, zdolnego do syntezowania i zmieniania obrazów na podstawie podanego wzoru lub opisu tekstowego w naturalnym języku. Kod narzędzi do szkolenia sieci neuronowej i generowania obrazów został napisany w języku Python z wykorzystaniem frameworka PyTorch i opublikowany na licencji MIT. Już wytrenowane modele są dostępne na licencji Creative ML OpenRAIL-M, która dopuszcza użycie w celach komercyjnych. Dodatkowo dostępny jest demonstracyjny generator obrazów online.

Kluczowe ulepszenia w nowej edycji Stable Diffusion:

  • Stworzono nowy model syntezy obrazów na podstawie opisu tekstowego — SD2.0-v, wspierający generowanie obrazów o rozdzielczości 768×768. Nowy model został wytrenowany z wykorzystaniem kolekcji LAION-5B, zawierającej 5,85 miliarda obrazów z opisami tekstowymi. Model używa tego samego zestawu parametrów co model Stable Diffusion 1.5, ale różni się przejściem na użycie zasadniczo innego kodera OpenCLIP-ViT/H, co pozwoliło znacznie poprawić jakość uzyskiwanych obrazów.
    Został zaprezentowany system syntezy obrazów Stable Diffusion 2.0
  • Przygotowano uproszczoną wersję SD2.0-base, wytrenowaną na obrazach 256×256 z użyciem klasycznego modelu przewidywania szumów i wspierającą generowanie obrazów o rozdzielczości 512×512.
    Został zaprezentowany system syntezy obrazów Stable Diffusion 2.0
  • Zaproponowano możliwość wykorzystania technologii superzastrzyki (Super Resolution) do zwiększenia rozdzielczości oryginalnego obrazu bez utraty jakości, przy użyciu algorytmów skalowania przestrzennego i rekonstrukcji szczegółów. Oferowany model obróbki obrazów (SD20-upscaler) wspiera czterokrotne powiększenie, co pozwala na tworzenie obrazów o rozdzielczości 2048×2048.
    Został zaprezentowany system syntezy obrazów Stable Diffusion 2.0
  • Proponowany model SD2.0-depth2img uwzględnia głębokość i przestrzenne rozmieszczenie obiektów. Do jednoocznej oceny głębokości wykorzystuje się system MiDaS. Model pozwala na syntezę nowych obrazów, wykorzystując inny obraz jako wzór, które mogą znacznie różnić się od oryginału, ale zachowują ogólną kompozycję i głębokość. Na przykład można wykorzystać postawę osoby na fotografii do stworzenia innej postaci w tej samej pozy.
    Został zaprezentowany system syntezy obrazów Stable Diffusion 2.0
    Został zaprezentowany system syntezy obrazów Stable Diffusion 2.0
    Został zaprezentowany system syntezy obrazów Stable Diffusion 2.0
  • Zaktualizowany model do modyfikacji obrazów — SD 2.0-inpainting, umożliwiający zastępowanie i zmienianie części obrazu za pomocą podpowiedzi tekstowych.
    Został zaprezentowany system syntezy obrazów Stable Diffusion 2.0
  • Przeprowadzono optymalizację modeli do użycia na typowych systemach z jednym GPU.

Został zaprezentowany system syntezy obrazów Stable Diffusion 2.0


Źródło: opennet.ru
Kup solidny hosting stron z ochroną przed DDoS, serwery VPS VDS 🔥 Kup solidny hosting stron z ochroną przed DDoS, serwery VPS VDS | ProHoster