Esitatud video sünteesi süsteem Stable Video Diffusion

Stability AI on avaldanud masinõppe mudeli Stable Video Diffusion, mis võimaldab genereerida lühikesi videoid piltide põhjal. Mudel laiendab Stable Diffusion projekti võimalusi, mis varem piirdusid staatiliste piltide sünteesiga. Neuraalvõrgu koolitamiseks ja piltide genereerimiseks mõeldud tööriistade kood on kirjutatud Pythonis, kasutades PyTorch raamistikku, ja see on avaldatud MIT litsentsi all. Juba koolitatud mudelid on avatud lubava litsentsi Creative ML OpenRAIL-M all, mis lubab kaubanduslikku kasutamist.

Laadimiseks on saadaval kaks mudeli versiooni: SVD (Stable Video Diffusion), mis genereerib 14 kaadrit resolutsiooniga 576×1024 antud staatilise pildi põhjal, ja SVD-XT, mis genereerib 25 kaadrit. Videote genereerimine on võimalik kas liikumiseta või väga aeglaselt kaamera pööramisel, kestusega kuni 4 sekundit. Otsene mudeli juhtimine loomuliku keele tekstipõhiselt ei ole veel toetatud, kuid algse pildi saab eelnevalt ette valmistada vanema mudeliga Stable Diffusion 2.1 ning seejärel muundada selle videoks, kasutades mudelit SVD.

Video kvalite ei tagasta veel täiuslikku fotorealismi ega garanteeri korrektset nägude ja inimese kujutamist. Kuid jõudluse osas ületab pakutud avatud mudel omanäolisi analooge ettevõtetelt Runway ja Pika Labs. Mudelit saab kergesti kohandada erinevate ülesannete täitmiseks, näiteks saab seda kasutada kolmemõõtmeliste kujude vormimiseks.

Vaata videot

Lisaks tasub märkida masinõppe tööriistade Video-LLaVA avaldamist, mis võimaldab luua objekti ühtset visuaalset esitamist, mis põhineb objekti koolitusprotsessis samaaegselt kasutatavate foto- ja videomaterjalide kasutamisel. Süsteemi saab kasutada näiteks sama objekti tuvastamiseks piltidel ja videotelt. Kood on kirjutatud Pythonis ja levitatakse Apache 2.0 litsentsi alusel.

Allikas: opennet.ru

Osta usaldusväärne veebihosting DDoS kaitsega, VPS VDS serverid 🔥 Osta usaldusväärne veebihosting DDoS kaitsega, VPS VDS serverid | ProHoster