Stability AI opublikowało drugą edycję systemu uczenia maszynowego Stable Diffusion, który może syntetyzować i modyfikować obrazy na podstawie sugerowanego szablonu lub opisu tekstowego w języku naturalnym. Kod narzędzi do trenowania sieci neuronowej i generowania obrazów jest napisany w Pythonie przy użyciu struktury PyTorch i opublikowany na licencji MIT. Już wytrenowane modele są otwarte na podstawie liberalnej licencji Creative ML OpenRAIL-M, która zezwala na komercyjne wykorzystanie. Ponadto dostępny jest demonstracyjny generator obrazów online.
Kluczowe usprawnienia w nowej edycji Stable Diffusion:
- Został stworzony nowy model syntezy obrazu na podstawie opisów tekstowych — SD2.0-v, który obsługuje generowanie obrazów o rozdzielczości 768×768. Nowy model został wytrenowany przy użyciu kolekcji LAION-5B, która zawiera 5.85 miliarda obrazów z opisami tekstowymi. Model wykorzystuje ten sam zestaw parametrów co model Stable Diffusion 1.5, ale różni się przejściem do korzystania z zasadniczo innego enkodera OpenCLIP-ViT/H, co znacznie poprawiło jakość uzyskanych obrazów.

- Przygotowano uproszczoną wersję SD2.0-base, trenowaną na obrazach o rozdzielczości 256x256 przy użyciu klasycznego modelu predykcji szumu i obsługującą generowanie obrazów o rozdzielczości 512x512.

- Zapewniono możliwość wykorzystania technologii Super Resolution w celu zwiększenia rozdzielczości oryginalnego obrazu bez obniżania jakości, wykorzystując algorytmy skalowania przestrzennego i rekonstrukcji szczegółów. Dostarczony model przetwarzania obrazu (SD20-upscaler) obsługuje czterokrotne skalowanie, co umożliwia tworzenie obrazów o rozdzielczości 2048×2048.

- Proponowany jest model SD2.0-depth2img, który uwzględnia głębokość i przestrzenne rozmieszczenie obiektów. System MiDaS jest używany do jednoocznej oceny głębokości. Model umożliwia syntezę nowych obrazów przy użyciu innego obrazu jako szablonu, który może radykalnie różnić się od oryginału, ale zachowuje ogólną kompozycję i głębię. Na przykład można użyć pozy osoby na zdjęciu, aby utworzyć inną postać w tej samej pozie.



- Zaktualizowano model modyfikacji obrazów - SD 2.0-inpainting, który umożliwia zastępowanie i zmianę części obrazu za pomocą podpowiedzi tekstowych.

- Modele zostały zoptymalizowane do użytku w standardowych systemach z jednym procesorem graficznym.

Źródło: opennet.ru







