Der Quellcode von Spleeter, einem System zur Trennung von Musik und Gesang, ist jetzt verfügbar.

Streaming-Anbieter Deezer Maßnahmen ergriffen Der Quellcode des experimentellen Projekts Spleeter entwickelt ein Machine-Learning-System zur Trennung von Klangquellen aus komplexen Klangkompositionen. Mit diesem Programm können Gesangsspuren entfernt und nur die musikalische Begleitung beibehalten werden. Es ermöglicht die Manipulation des Klangs einzelner Instrumente oder das Entfernen der Musik, um die Stimme für die Überlagerung mit einem anderen Audiotrack, für Mixe, Karaoke oder Transkriptionen zu nutzen. Der Projektcode ist in Python unter Verwendung der Tensorflow-Engine geschrieben und wird unter der GPLv3-Lizenz bereitgestellt. unter der MIT-Lizenz.

Zum Download vorgeschlagene bereits trainierte Modelle zur Trennung von Gesang (einer Stimme) von der Begleitung sowie zur Trennung in 4 und 5 Streams, die Gesang, Schlagzeug, Bass, Klavier und andere Klänge umfassen. Spleeter kann sowohl als Python-Bibliothek als auch als eigenständiges Kommandozeilen-Tool verwendet werden. In der einfachsten Form wird auf Basis der Quelldatei erstellt zwei, vier oder fünf Dateien mit Gesang und den Komponenten der Begleitung (vocals.wav, drums.wav, bass.wav, piano.wav, other.wav).

Beim Aufteilen auf 2 und 4 Threads bietet Spleeter eine sehr hohe Leistung. Beispielsweise dauert die Aufteilung einer Audiodatei auf 4 Threads unter Verwendung einer GPU 100 Mal weniger Zeit als die Dauer der ursprünglichen Komposition. Auf einem System mit einer NVIDIA GeForce GTX 1080 GPU und einem 32-Kern Intel Xeon Gold 6134 CPU wurde die Verarbeitung der Testkollektion musDB, die 3 Stunden und 27 Minuten dauert, in 90 Sekunden durchgeführt.

Der Quellcode von Spleeter, einem System zur Trennung von Musik und Gesang, ist jetzt verfügbar.



Zu den Vorteilen von Spleeter im Vergleich zu anderen Entwicklungen im Bereich der Audio-Trennung, wie dem Open-Source-Projekt Open-Unmix, zählt die Anwendung qualitativ hochwertigerer Modelle, die auf einer umfangreichen Sammlung von Audiodateien basieren. Aufgrund von Urheberrechtsbeschränkungen haben Forscher im Bereich des maschinellen Lernens nur Zugriff auf recht spärliche öffentliche Sammlungen musikalischer Dateien, während für Spleeter Modelle unter Nutzung von Daten aus dem umfangreichen Musikkatalog von Deezer erstellt wurden.

Nach im Vergleich Mit Open-Unmix erreicht Spleeter bei der Trennung eine etwa 35 % schnellere Leistung im CPU-Test, unterstützt MP3-Dateien und liefert deutlich qualitativ hochwertigere Ergebnisse (bei der Stimmtrennung in Open-Unmix bleiben einige Instrumente erhalten, was wahrscheinlich darauf zurückzuführen ist, dass die Modelle von Open-Unmix auf einer Sammlung von insgesamt 150 Kompositionen trainiert wurden).

Quelle: opennet.ru

Zuverlässiges Webhosting mit DDoS-Schutz, VPS- und VDS-Server kaufen 🔥 Zuverlässiges Webhosting mit DDoS-Schutz, VPS- und VDS-Server kaufen | ProHoster