Ettevõte Stability AI avaldas teise versiooni masinõppe süsteemist Stable Diffusion, mis suudab sünteesida ja muuta pilte, tuginedes etteantud mallile või looduskeeles esitatud kirjeldusele. Neuralvõrgustiku koolitamiseks ja piltide genereerimiseks mõeldud tööriistade kood on kirjutatud Pythonis, kasutades PyTorch raamistikku ja avaldatud MIT litsentsi alusel. Juba koolitatud mudelid on avatud permissiivse litsentsi Creative ML OpenRAIL-M all, mis lubab kasutamist ka kaubandustegevuses. Samuti on saadaval näidis online-pildigeneraator.
Uue versiooni Stable Diffusion peamised täiustused:
- Loodud on uus pildisünteesi mudel tekstikirjelduse järgi — SD2.0-v, mis toetab 768×768 pikslise resolutsiooniga piltide genereerimist. Uus mudel on koolitatud LAION-5B kogu kogumise põhjal, mis sisaldab 5,85 miljardit pilti koos tekstikirjeldustega. Mudel kasutab samu parameetreid kui Stable Diffusion 1.5 mudel, kuid erineb avatud OpenCLIP-ViT/H kodeerija kasutuselevõtust, mis on võimaldanud oluliselt parandada saadud piltide kvaliteeti.

- Valmistatud on lihtsustatud versioon SD2.0-base, mis on koolitatud 256×256 piltide peal, kasutades klassikalist müraennustamise mudelit ja toetades 512×512 pikslise resolutsiooniga piltide genereerimist.

- On antud võimalus kasutada superresolutsiooni tehnoloogiat, et suurendada algpildi resolutsiooni kvaliteedi vähenemiseta, kasutades ruumilise suurendamise ja detailide rekonstruktsiooni algoritme. Pakutav pilditöötluse mudel (SD20-upscaler) toetab neljakordset suurendust, võimaldades luua 2048×2048 piksliga pilte.

- Pakutud mudel SD2.0-depth2img arvestab objektide sügavust ja ruumilist paigutust. Ühekaameralise sügavuse hindamiseks kasutatakse MiDaS süsteemi. Mudel võimaldab sünteesida uusi pilte, kasutades teist pilti malleena, mis võivad oluliselt erineda originaalist, kuid säilitavad üldise kompositsiooni ja sügavuse. Näiteks võib inimese poosi fotol kasutada teise tegelase kujundamiseks samas poosis.



- Uuendatud mudel piltide modifitseerimiseks — SD 2.0-inpainting, mis võimaldab tekstiliste vihjete abil asendada ja muuta osa pildist.

- Mudelite optimeerimine tavalistele süsteemidele, kus on üks GPU.

Allikas: opennet.ru







