Ettevõte Stability AI avaldas teise redaktsiooni masinõppe süsteemist Stable Diffusion, mis suudab sünteesida ja muuta pilte, tuginedes antud mallile või tekstikirjeldusele looduslikus keeles. Neurovõrgu koolitamise ja piltide genereerimise tööriistade kood on kirjutatud Pythonis, kasutades raamistikku PyTorch, ning see on avaldatud MIT litsentsi alusel. Juba koolitatud mudelid on avatud lubava Creative ML OpenRAIL-M litsentsi alusel, mis lubab kasutamist ka ärilistel eesmärkidel. Lisaks on saadaval ka näidis online-piltide generaator.
Uute täiustuste hulka kuulub uus redaktsioon Stable Diffusion:
- Koolitatud on uus tekstikirjeldustel põhineva piltide sünteesi mudel — SD2.0-v, mis toetab 768×768 resolutsiooniga piltide genereerimist. Uus mudel on koolitatud LAION-5B kogumil, mis sisaldab 5,85 miljardit pilti koos tekstikirjeldustega. Mudel kasutab samu parameetreid nagu Stable Diffusion 1.5 mudel, kuid erineb põhimõtteliselt uue OpenCLIP-ViT/H kodeerija kasutamisest, mis on võimaldanud oluliselt parandada genereeritavate piltide kvaliteeti.

- Valmistatud on lihtsustatud versioon SD2.0-base, mis on koolitatud 256×256 piltide põhjal, kasutades klassikalist müraennustamise mudelit ja toetades 512×512 resolutsiooniga piltide genereerimist.

- Pakkuda on võimalus kasutada superresolutsiooni tehnoloogiat (Super Resolution) algpildi resolutsiooni suurendamiseks kvaliteeti langetamata, kasutades ruumilisi skaleerimise ja detailide rekonstrueerimise algoritme. Pakutud pilditöötlusmudel (SD20-upscaler) toetab neljakordset suurendust, mis võimaldab genereerida 2048×2048 resolutsiooniga pilte.

- Pakutud on mudel SD2.0-depth2img, mis arvestab objektide sügavuse ja ruumilise asetusega. Monokulaarse sügavuse hindamise jaoks kasutatakse MiDaS süsteemi. Mudel võimaldab sünteesida uusi pilte, kasutades muud pilti mallina, mis võivad oluliselt erineda originaalist, kuid säilitavad üldise kompositsiooni ja sügavuse. Näiteks võib kasutada inimese poosi fotol, et luua teine tegelane samas poosis.



- Uuendatud piltide muutmise mudel — SD 2.0-inpainting, mis võimaldab tekstipõhiste vihjete abil asendada ja muuta pildi osi.

- Mudelite optimeerimine on viidud ellu, et neid saaks kasutada tavapärastes ühes GPU-süsteemides.

Allikas: opennet.ru







