Der Code von Spleeter, einem System zur Trennung von Musik und Stimme, ist veröffentlicht worden.

Der Streaming-Anbieter Deezer hat eröffnet die Quelltexte des experimentellen Projekts Spleeter, das ein maschinelles Lernsystem zur Trennung von Klangquellen aus komplexen Musikkompositionen entwickelt. Das Programm ermöglicht es, den Gesang aus einer Komposition zu entfernen und nur die musikalische Begleitung zu belassen, den Klang einzelner Instrumente zu manipulieren oder die Musik zu entfernen und den Gesang für das Overlay mit anderen Audiospuren, für Mixe, Karaoke oder Transkriptionen zu nutzen. Der Code des Projekts wurde in der Programmiersprache Python unter Verwendung der Tensorflow-Engine geschrieben und wird verbreitet unterliegt der MIT-Lizenz.

Zum Herunterladen angeboten bereits trainierte Modelle zur Trennung von Gesang (einer Stimme) von der Begleitung sowie zur Trennung in 4 und 5 Ströme, die Gesang, Schlagzeug, Bass, Klavier und andere Klänge umfassen. Spleeter kann sowohl als Python-Bibliothek als auch als eigenständige Kommandozeilenanwendung verwendet werden. Im einfachsten Fall werden auf Basis der Originaldatei zwei, vier oder fünf Dateien mit Gesang und Elementen aus der Begleitung (vocals.wav, drums.wav, bass.wav, piano.wav, other.wav) erstellt. Bei der Trennung in 2 und 4 Ströme bietet Spleeter eine sehr hohe Leistung. Zum Beispiel benötigt die Trennung einer Audiodatei in 4 Ströme auf einem System mit GPU 100 Mal weniger Zeit als die Dauer der Originalkomposition. Auf einem System mit einer NVIDIA GeForce GTX 1080 GPU und einem 32-Kern Intel Xeon Gold 6134 Prozessor wurde die Verarbeitung einer Testkollektion von musDB, die drei Stunden und 27 Minuten dauert, in 90 Sekunden durchgeführt.

Zu den Vorteilen von Spleeter im Vergleich zu anderen Entwicklungen im Bereich der Klangtrennung, wie dem Open-Source-Projekt

Der Code von Spleeter, einem System zur Trennung von Musik und Stimme, ist veröffentlicht worden.



Open-Unmix , gehört die Verwendung von qualitativ hochwertigeren Modellen, die auf der Grundlage einer umfangreichen Sammlung von Audiodateien aufgebaut sind. Aufgrund von Urheberrechtsbeschränkungen sind Forscher im Bereich des maschinellen Lernens beim Zugang zu ziemlich spärlichen öffentlich zugänglichen Sammlungen von Musikdateien eingeschränkt, während für Spleeter Modelle unter Einbeziehung von Daten aus einem umfangreichen Musik-Katalog von Deezer erstellt wurden.im Vergleich

Nach Vergleich Mit Open-Unmix arbeitet das Tool Spleeter etwa 35 % schneller bei CPU-Tests, unterstützt MP3-Dateien und erzeugt ein deutlich qualitativ besseres Ergebnis (bei der Trennung der Stimme in Open-Unmix bleiben Spuren einiger Instrumente zurück, was wahrscheinlich darauf zurückzuführen ist, dass die Modelle von Open-Unmix auf einer Sammlung von lediglich 150 Kompositionen trainiert wurden).

Quelle: opennet.ru

60GB SSD 8Gb DDR4