Das Unternehmen Stability AI hat das Machine-Learning-Modell Stable Video Diffusion veröffentlicht, das es ermöglicht, kurze Videos basierend auf Bildern zu generieren. Dieses Modell erweitert die Möglichkeiten des vorher auf die Synthese statischer Bilder beschrĂ€nkten Projekts Stable Diffusion. Der Code fĂŒr die Werkzeuge zur Schulung des neuronalen Netzwerks und zur Bildgenerierung ist in Python unter Verwendung des PyTorch-Frameworks geschrieben und wurde unter der MIT-Lizenz veröffentlicht. Bereits trainierte Modelle stehen unter der permissiven Lizenz Creative ML OpenRAIL-M zur VerfĂŒgung, die kommerzielle Nutzung erlaubt.
FĂŒr den Download stehen zwei Varianten des Modells zur VerfĂŒgung: SVD (Stable Video Diffusion) zur Generierung von 14 Frames mit einer Auflösung von 576Ă1024 auf der Grundlage eines gegebenen statischen Bildes und SVD-XT zur Generierung von 25 Frames. Es ist möglich, Videos ohne Bewegung oder mit sehr langsamer KamerafĂŒhrung zu erstellen, die nicht lĂ€nger als 4 Sekunden dauern. Die direkte Steuerung des Modells anhand einer textuellen Beschreibung in natĂŒrlicher Sprache wird derzeit noch nicht unterstĂŒtzt, aber es ist möglich, das Ausgangsbild zuerst mit dem alten Modell Stable Diffusion 2.1 vorzubereiten und es dann mit dem SVD-Modell in ein Video zu konvertieren.
Die VideoqualitĂ€t erreicht derzeit noch nicht den perfekten fotorealistischen Standard und garantiert keine korrekte Darstellung von Gesichtern und Menschen. In Bezug auf die Leistung ĂŒbertrifft das angebotene Open-Source-Modell proprietĂ€re Lösungen von Unternehmen wie Runway und Pika Labs. Das Modell kann leicht an verschiedene Anforderungen angepasst werden, beispielsweise zur Erstellung von dreidimensionalen Objekten.

Ein weiteres hervorzuhebendes Projekt ist das Veröffentlichungswerkzeug fĂŒr maschinelles Lernen, Video-LLaVA, das einheitliche visuelle Darstellungen von Objekten schafft, die auf der gleichzeitigen Verwendung von Fotos und Videos wĂ€hrend des Trainings basieren. Das System kann beispielsweise zur Erkennung desselben Objekts in Bildern und Videos eingesetzt werden. Der Code ist in Python geschrieben und steht unter der Apache 2.0 Lizenz.
Quelle: opennet.ru
