Der Streaming-Anbieter Deezer die Quelltexte des experimentellen Projekts Spleeter, das ein maschinelles Lernsystem zur Trennung von Klangquellen aus komplexen Musikkompositionen entwickelt. Das Programm ermöglicht es, den Gesang aus einer Komposition zu entfernen und nur die musikalische Begleitung zu belassen, den Klang einzelner Instrumente zu manipulieren oder die Musik zu entfernen und den Gesang für das Overlay mit anderen Audiospuren, für Mixe, Karaoke oder Transkriptionen zu nutzen. Der Code des Projekts wurde in der Programmiersprache Python unter Verwendung der Tensorflow-Engine geschrieben und unterliegt der MIT-Lizenz.
Zum Herunterladen bereits trainierte Modelle zur Trennung von Gesang (einer Stimme) von der Begleitung sowie zur Trennung in 4 und 5 Ströme, die Gesang, Schlagzeug, Bass, Klavier und andere Klänge umfassen. Spleeter kann sowohl als Python-Bibliothek als auch als eigenständige Kommandozeilenanwendung verwendet werden. Im einfachsten Fall werden auf Basis der Originaldatei Bei der Trennung in 2 und 4 Ströme bietet Spleeter eine sehr hohe Leistung. Zum Beispiel benötigt die Trennung einer Audiodatei in 4 Ströme auf einem System mit GPU 100 Mal weniger Zeit als die Dauer der Originalkomposition. Auf einem System mit einer NVIDIA GeForce GTX 1080 GPU und einem 32-Kern Intel Xeon Gold 6134 Prozessor wurde die Verarbeitung einer Testkollektion von musDB, die drei Stunden und 27 Minuten dauert, in 90 Sekunden durchgeführt.
Zu den Vorteilen von Spleeter im Vergleich zu anderen Entwicklungen im Bereich der Klangtrennung, wie dem Open-Source-Projekt
Open-Unmix im Vergleich
Nach Mit Open-Unmix arbeitet das Tool Spleeter etwa 35 % schneller bei CPU-Tests, unterstützt MP3-Dateien und erzeugt ein deutlich qualitativ besseres Ergebnis (bei der Trennung der Stimme in Open-Unmix bleiben Spuren einiger Instrumente zurück, was wahrscheinlich darauf zurückzuführen ist, dass die Modelle von Open-Unmix auf einer Sammlung von lediglich 150 Kompositionen trainiert wurden).
Quelle: opennet.ru
