Kompania Stability AI publikoi edicionin e dytë të sistemit të mësimit të makinerive Stable Diffusion, i aftë për të sintetizuar dhe ndryshuar imazhe bazuar në një model të dhënë ose përshkrim tekstual në gjuhën natyrore. Kodi i mjeteve për trajnimin e rrjetit neural dhe gjenerimin e imazheve është shkruar në gjuhën Python duke përdorur kuadrin PyTorch dhe është publikuar nën licencën MIT. Modelet e trajnimit tashmë janë të hapura nën licencën e lejuar Creative ML OpenRAIL-M, e cila lejon përdorimin për qëllime komerciale. Gjithashtu është në dispozicion një gjenerator imazhesh online për demonstrim.
Përmirësimet kryesore në edicionin e ri të Stable Diffusion:
- ĂshtĂ« krijuar njĂ« model i ri i sintetizimit tĂ« imazheve sipas pĂ«rshkrimit tekstual â SD2.0-v, i cili mbĂ«shtet gjenerimin e imazheve me rezolucion 768Ă768. Modeli i ri Ă«shtĂ« trajnuar me koleksionin LAION-5B, i cili pĂ«rfshin 5.85 miliard imazhesh me pĂ«rshkrime tekstuale. Modeli pĂ«rdor tĂ« njĂ«jtin set parametrash si modeli Stable Diffusion 1.5, por ndryshon me kalimin nĂ« pĂ«rdorimin e njĂ« kodifikuesi tĂ«rĂ«sisht tĂ« ndryshĂ«m OpenCLIP-ViT/H, qĂ« ka lejuar pĂ«rmirĂ«simin e ndjeshĂ«m tĂ« cilĂ«sisĂ« sĂ« imazheve pĂ«rfundimtare.

- ĂshtĂ« pĂ«rgatitur njĂ« variant i thjeshtuar SD2.0-base, i trajnuar nĂ« imazhe 256Ă256 duke pĂ«rdorur modelin klasik tĂ« parashikimit tĂ« zhurmĂ«s dhe mbĂ«shtet gjenerimin e imazheve me rezolucion 512Ă512.

- ĂshtĂ« ofruar mundĂ«sia e pĂ«rdorimit tĂ« teknologjisĂ« sĂ« super-sampling (Super Resolution) pĂ«r tĂ« rritur rezolucionin e imazhit fillestar pa ulur cilĂ«sinĂ«, duke pĂ«rdorur algoritme tĂ« shkallĂ«zimit hapĂ«sinor dhe rindĂ«rtimit tĂ« detajeve. Modeli i ofruar pĂ«r pĂ«rpunimin e imazheve (SD20-upscaler) mbĂ«shtet rritjen katĂ«rfish, e cila lejon formimin e imazheve me rezolucion 2048Ă2048.

- ĂshtĂ« propozuar modeli SD2.0-depth2img, i cili merr parasysh thellĂ«sinĂ« dhe vendndodhjen hapĂ«sinore tĂ« objekteve. PĂ«r vlerĂ«simin monokular tĂ« thellĂ«sisĂ«, pĂ«rdoret sistemi MiDaS. Modeli lejon qĂ« tĂ« sintetizohen imazhe tĂ« reja, duke pĂ«rdorur njĂ« imazh tjetĂ«r si model, tĂ« cilat mund tĂ« ndryshojnĂ« rrĂ«njĂ«sisht nga origjinali, por tĂ« ruajnĂ« kompozitĂ«n dhe thellĂ«sinĂ« e pĂ«rgjithshme. PĂ«r shembull, mund tĂ« pĂ«rdoret pozita e njĂ« personi nĂ« foto pĂ«r tĂ« formuar njĂ« karakter tjetĂ«r nĂ« tĂ« njĂ«jtĂ«n pozĂ«.



- Modeli për modifikimin e imazheve është azhurnuar - SD 2.0-inpainting, e cila lejon, me ndihmën e sugjerimeve tekstuale, të zëvendësojë dhe ndryshojë pjesë të imazhit.

- Janë optimizuar modelet për përdorim në sisteme standarde me një GPU.

Burimi: opennet.ru







