Il fornitore di streaming Deezer i codici sorgente del progetto sperimentale Spleeter, che sviluppa un sistema di apprendimento automatico per la separazione delle fonti audio da composizioni sonore complesse. Il programma consente di rimuovere la voce da una composizione e mantenere solo il supporto musicale, manipolare il suono degli strumenti singoli o eliminare la musica e mantenere la voce per sovrapporla a un altro brano audio, creare mix, karaoke o trascrizioni. Il codice del progetto è scritto in Python utilizzando il motore Tensorflow e sotto licenza MIT.
Per il download modelli già addestrati per separare la voce (una sola voce) dall'accompagnamento, nonché per la separazione in 4 e 5 flussi, che includono voce, batteria, basso, pianoforte e altri suoni. Spleeter può essere utilizzato sia come libreria Python che come utility a riga di comando autonoma. Nel caso più semplice, partendo da un file sorgente due, quattro o cinque file con la voce e gli elementi dell'accompagnamento (vocals.wav, drums.wav, bass.wav, piano.wav, other.wav).
Dividendo in 2 e 4 flussi, Spleeter offre prestazioni molto elevate; ad esempio, utilizzando una GPU, la separazione di un file audio in 4 flussi richiede 100 volte meno tempo rispetto alla durata della composizione originale. Su un sistema con GPU NVIDIA GeForce GTX 1080 e CPU Intel Xeon Gold 6134 a 32 core, l'elaborazione della collezione di test musDB, della durata di tre ore e 27 minuti, è stata completata in 90 secondi.
Tra i vantaggi di Spleeter rispetto ad altri sviluppi nel campo della separazione audio, come il progetto open source , si menziona l'uso di modelli di maggiore qualità, realizzati su una vasta collezione di file audio. A causa delle limitazioni legate ai diritti d'autore, i ricercatori nel campo dell'apprendimento automatico hanno accesso a collezioni musicali pubbliche piuttosto scarne, mentre per Spleeter i modelli sono stati costruiti utilizzando dati da un ampio catalogo musicale di Deezer.
Secondo Con Open-Unmix, lo strumento Spleeter esegue la separazione circa il 35% più velocemente durante i test su CPU, supporta file MP3 e genera risultati visibilmente migliori (separando la voce in Open-Unmix rimangono tracce di alcuni strumenti, il che è probabilmente spiegato dal fatto che i modelli Open-Unmix sono stati addestrati su una collezione di sole 150 composizioni).
Fonte: opennet.ru
