Il fornitore di streaming Deezer i codici sorgente del progetto sperimentale Spleeter, che sviluppa un sistema di apprendimento automatico per la separazione delle sorgenti sonore da composizioni musicali complesse. Il programma consente di rimuovere dalla composizione la voce e mantenere solo l'accompagnamento musicale, manipolare il suono di strumenti singoli o eliminare la musica e mantenere la voce per sovrapporla a un'altra traccia sonora, creare mix, karaoke o trascrizioni. Il codice del progetto è scritto in Python utilizzando il motore Tensorflow e sotto licenza MIT.
Per scaricare modelli già addestrati per separare la voce (una voce) dall'accompagnamento, così come per la separazione in 4 e 5 canali, inclusi voce, batteria, basso, pianoforte e altri suoni. Spleeter può essere utilizzato sia come libreria Python che come utility da riga di comando autonoma. Nel caso più semplice basato su un file sorgente due, quattro o cinque file con la voce e le componenti dell'accompagnamento (vocals.wav, drums.wav, bass.wav, piano.wav, other.wav).
Nella separazione in 2 e 4 flussi, Spleeter offre prestazioni molto elevate; ad esempio, utilizzando una GPU, la separazione di un file audio in 4 flussi richiede 100 volte meno tempo rispetto alla durata della composizione originale. Su un sistema con GPU NVIDIA GeForce GTX 1080 e CPU Intel Xeon Gold 6134 a 32 core, l'elaborazione di una collezione di test musDB della durata di tre ore e 27 minuti è stata completata in 90 secondi.
Tra i vantaggi di Spleeter, rispetto ad altre soluzioni nel campo della separazione del suono, come il progetto open source , vi è l'uso di modelli di qualità superiore, costruiti su una vasta collezione di file audio. A causa delle limitazioni dei diritti d'autore, i ricercatori nel campo dell'apprendimento automatico hanno accesso a collezioni musicali pubbliche piuttosto scarse, mentre per Spleeter i modelli sono stati costruiti utilizzando dati provenienti da un ampio catalogo musicale Deezer.
Secondo Con Open-Unmix, lo strumento Spleeter esegue la separazione circa il 35% più velocemente durante i test su CPU, supporta file MP3 e genera risultati significativamente più qualitativi (nella separazione della voce con Open-Unmix rimangono tracce di alcuni strumenti, il che probabilmente è spiegato dal fatto che i modelli di Open-Unmix sono stati addestrati su una collezione di sole 150 composizioni).
Fonte: opennet.ru
