Codice di Spleeter aperto, un sistema per separare musica e voce

Il fornitore di streaming Deezer ha aperto i codici sorgente del progetto sperimentale Spleeter, che sviluppa un sistema di apprendimento automatico per la separazione delle sorgenti sonore da composizioni musicali complesse. Il programma consente di rimuovere dalla composizione la voce e mantenere solo l'accompagnamento musicale, manipolare il suono di strumenti singoli o eliminare la musica e mantenere la voce per sovrapporla a un'altra traccia sonora, creare mix, karaoke o trascrizioni. Il codice del progetto è scritto in Python utilizzando il motore Tensorflow e è distribuito sotto licenza MIT.

Per scaricare vengono suggeriti modelli già addestrati per separare la voce (una voce) dall'accompagnamento, così come per la separazione in 4 e 5 canali, inclusi voce, batteria, basso, pianoforte e altri suoni. Spleeter può essere utilizzato sia come libreria Python che come utility da riga di comando autonoma. Nel caso più semplice basato su un file sorgente viene creato due, quattro o cinque file con la voce e le componenti dell'accompagnamento (vocals.wav, drums.wav, bass.wav, piano.wav, other.wav).

Nella separazione in 2 e 4 flussi, Spleeter offre prestazioni molto elevate; ad esempio, utilizzando una GPU, la separazione di un file audio in 4 flussi richiede 100 volte meno tempo rispetto alla durata della composizione originale. Su un sistema con GPU NVIDIA GeForce GTX 1080 e CPU Intel Xeon Gold 6134 a 32 core, l'elaborazione di una collezione di test musDB della durata di tre ore e 27 minuti è stata completata in 90 secondi.

Codice di Spleeter aperto, un sistema per separare musica e voce



Tra i vantaggi di Spleeter, rispetto ad altre soluzioni nel campo della separazione del suono, come il progetto open source Open-Unmix, vi è l'uso di modelli di qualità superiore, costruiti su una vasta collezione di file audio. A causa delle limitazioni dei diritti d'autore, i ricercatori nel campo dell'apprendimento automatico hanno accesso a collezioni musicali pubbliche piuttosto scarse, mentre per Spleeter i modelli sono stati costruiti utilizzando dati provenienti da un ampio catalogo musicale Deezer.

Secondo in confronto Con Open-Unmix, lo strumento Spleeter esegue la separazione circa il 35% più velocemente durante i test su CPU, supporta file MP3 e genera risultati significativamente più qualitativi (nella separazione della voce con Open-Unmix rimangono tracce di alcuni strumenti, il che probabilmente è spiegato dal fatto che i modelli di Open-Unmix sono stati addestrati su una collezione di sole 150 composizioni).

Fonte: opennet.ru

Acquista hosting affidabile per siti web con protezione DDoS, VPS VDS server 🔥 Acquista hosting affidabile per siti web con protezione DDoS, VPS VDS server | ProHoster