L'azienda Stability AI ha rilasciato il modello di machine learning Stable Video Diffusion, che consente di generare brevi video a partire da immagini. Questo modello amplia le capacità del progetto Stable Diffusion, precedentemente limitato alla sintesi di immagini statiche. Il codice degli strumenti per l'addestramento della rete neurale e la generazione delle immagini è scritto in Python utilizzando il framework PyTorch ed è stato pubblicato con licenza MIT. I modelli già addestrati sono resi disponibili sotto la licenza permissiva Creative ML OpenRAIL-M, che ne consente l'uso a scopi commerciali.
Sono disponibili due varianti del modello per il download: SVD (Stable Video Diffusion) per generare 14 fotogrammi con risoluzione 576×1024 a partire da un'immagine statica fornita e SVD-XT per generare 25 fotogrammi. È possibile generare video senza movimenti o con una rotazione molto lenta della fotocamera, con una durata massima di 4 secondi. Il controllo diretto del modello tramite descrizioni testuali in linguaggio naturale non è ancora supportato, ma è possibile preparare inizialmente l'immagine di partenza utilizzando il modello precedente Stable Diffusion 2.1 e poi trasformarla in video usando il modello SVD.
La qualità video attualmente non garantisce un fotorealismo perfetto e un rendering corretto di volti e persone. In termini di prestazioni, il modello open source proposto supera i suoi analoghi proprietari delle aziende Runway e Pika Labs. Il modello può facilmente adattarsi per affrontare diverse attività, ad esempio, può essere utilizzato per formare figure tridimensionali.

Inoltre, si segnala la pubblicazione dello strumento di machine learning Video-LLaVA, che consente di creare una rappresentazione visiva unificata di un oggetto, generata utilizzando foto e video durante l'addestramento. Il sistema può essere utilizzato, ad esempio, per riconoscere la presenza degli stessi oggetti nelle immagini e nei video. Il codice è scritto in Python e distribuito con licenza Apache 2.0.
Fonte: opennet.ru
