Das Projekt Riffusion entwickelt eine Variante des maschinellen Lernsystems Stable Diffusion, die zur Generierung von Musik statt von Bildern geeignet ist. Musik kann aus einer textuellen Beschreibung in natĂŒrlicher Sprache oder basierend auf einer vorgeschlagenen Vorlage synthetisiert werden. Die Komponenten zur Musik-Synthese sind in Python unter Verwendung des PyTorch-Frameworks geschrieben und sind unter der MIT-Lizenz verfĂŒgbar. Die Schnittstelle ist in TypeScript implementiert und wird ebenfalls unter der MIT-Lizenz vertrieben. Die trainierten Modelle sind unter der permissiven Lizenz Creative ML OpenRAIL-M öffentlich zugĂ€nglich, die die kommerzielle Nutzung erlaubt.
Das Projekt ist interessant, da es weiterhin Modelle âvon Text zu Bildâ und âvon Bild zu Bildâ zur Generierung von Musik verwendet, aber dabei mit Spektrogrammen anstelle von Bildern arbeitet. Mit anderen Worten, das klassische Stable Diffusion wurde nicht auf Fotografien und Bildern, sondern auf Spektrogramm-Darstellungen trainiert, die die VerĂ€nderung von Frequenz und Amplitude einer Schallwelle ĂŒber die Zeit widerspiegeln. Infolgedessen wird auch ein Spektrogramm ausgegeben, das dann in eine klangliche Darstellung umgewandelt wird.

Die Methode kann auch verwendet werden, um vorhandene Klangkompositionen zu verĂ€ndern und Musik anhand von Vorlagen zu synthetisieren, Ă€hnlich wie bei der Modifikation von Bildern in Stable Diffusion. Beispielsweise können bei der Generierung Spektrogramm-Vorlagen mit einem Referenzstil festgelegt, verschiedene Stile kombiniert, ein sanfter Ăbergang von einem Stil zum anderen durchgefĂŒhrt oder Ănderungen an bestehendem Klang vorgenommen werden, um Aufgaben wie die Erhöhung der LautstĂ€rke bestimmter Instrumente, das Ăndern des Tempos oder den Austausch von Instrumenten zu lösen. Vorlagen werden auch zur Generierung von langanhaltenden Kompositionen verwendet, die aus einer Reihe von sich zeitlich leicht Ă€ndernden Ausschnitten bestehen. Separat generierte Ausschnitte werden durch Interpolation interner Modellparameter zu einem kontinuierlichen Fluss zusammengefĂŒhrt.

Zur Erstellung eines Spektrogramms aus Klang wird die Fenster-Fourier-Transformation verwendet. Bei der Rekonstruktion des Klangs aus dem Spektrogramm entsteht das Problem, die Phasen zu bestimmen (im Spektrogramm sind nur Frequenz und Amplitude vorhanden); zur Rekonstruktion wird der Griffin-Lim aproximierende Algorithmus eingesetzt.
Quelle: opennet.ru
