Kompania Stability AI publikoi edicionin e dytë të sistemit të mësimit të makinerive Stable Diffusion, i cili është në gjendje të sintetizojë dhe modifikojë imazhe mbi bazën e një modeli të propozuar ose përshkrimit të tekstit në gjuhën natyrore. Kodi i mjeteve për trajnim të rrjetit nervor dhe gjenerimin e imazheve është shkruar në gjuhën Python duke përdorur kornizën PyTorch dhe është publikuar nën licencën MIT. Modelet e trajnuara tashmë janë të hapura nën licencën e lejuar Creative ML OpenRAIL-M, që lejon përdorimin për qëllime komerciale. Përveç kësaj, është në dispozicion një gjenerues imazhesh online demonstrues.
Përmirësimet kryesore në editionin e ri të Stable Diffusion:
- Është krijuar një model i ri i sintezës së imazheve nga përshkrimi i tekstit — SD2.0-v, që mbështet gjenerimin e imazheve me rezolucion 768×768. Modeli i ri është trajnuar duke përdorur koleksionin LAION-5B, që përmban 5.85 miliard imazhesh me përshkrime teksti. Modeli përdor të njëjtin set parametrash si modeli Stable Diffusion 1.5, por ndryshon me kalimin në përdorimin e një koduesi krejtësisht të ndryshëm OpenCLIP-ViT/H, duke lejuar një rritje të konsiderueshme të cilësisë së imazheve rezultuese.

- Është përgatitur një version i thjeshtuar SD2.0-base, i trajnuar mbi imazhe 256×256 duke përdorur modelin klasik të parashikimit të zhurmës dhe mbështet gjenerimin e imazheve me rezolucion 512×512.

- Është ofruar mundësia e përdorimit të teknologjisë së super-sampling (Super Resolution) për të rritur rezolucionin e imazhit origjinal pa komprometuar cilësinë, duke përdorur algoritme të shkallëzimit hapësinor dhe rinovimit të detajeve. Modeli i ofruar për përpunimin e imazheve (SD20-upscaler) mbështet një rritje katërfishe, duke e bërë të mundur krijimin e imazheve me rezolucion 2048×2048.

- Është propozuar modeli SD2.0-depth2img, që konsideron thellësinë dhe pozicionin hapësinor të objekteve. Për vlerësimin monotuar të thellësisë përdoret sistemi MiDaS. Modeli lejon sintezën e imazheve të reja, duke përdorur një imazh tjetër si model, që mund të ndryshojë radikalisht nga origjinali, por ruan kompozitën dhe thellësinë e përgjithshme. Për shembull, mund të përdoret pozita e një personi në një fotografi për të formuar një karakter tjetër në të njëjtin pozicion.



- Është përditësuar modeli për modifikimin e imazheve — SD 2.0-inpainting, që lejon, me ndihmën e sugjerimeve tekstuale, të zëvendësojë dhe të ndryshojë pjesë të imazhit.

- Është kryer optimizimi i modeleve për përdorim në sistemet standarde me një GPU.

Burimi: opennet.ru







