El proveedor de streaming Deezer los códigos fuente del proyecto experimental Spleeter, que desarrolla un sistema de aprendizaje automático para separar fuentes de sonido de composiciones sonoras complejas. El programa permite eliminar la voz de una composición y dejar solo la instrumental, manipular el sonido de instrumentos individuales o descartar la música y conservar la voz para superponerla sobre otra pista sonora, crear mezclas, karaoke o transcripciones. El código del proyecto está escrito en Python utilizando el motor Tensorflow y bajo licencia MIT.
Para descargar modelos ya entrenados para separar la voz (una sola voz) de la instrumentación, así como para dividir en 4 y 5 flujos, incluyendo voz, batería, bajos, piano y otros sonidos. Spleeter puede utilizarse tanto como una biblioteca de Python como en forma de una utilidad de línea de comandos. En el caso más simple, a partir de un archivo de origen dos, cuatro o cinco archivos con la voz y los componentes de la instrumentación (vocals.wav, drums.wav, bass.wav, piano.wav, other.wav).
Al dividir en 2 y 4 flujos, Spleeter ofrece un rendimiento muy alto; por ejemplo, al utilizar una GPU, la separación de un archivo de sonido en 4 flujos toma 100 veces menos tiempo que la duración de la composición original. En un sistema con GPU NVIDIA GeForce GTX 1080 y CPU Intel Xeon Gold 6134 de 32 núcleos, el procesamiento de una colección de pruebas musDB, con una duración de tres horas y 27 minutos, se completó en 90 segundos.
Entre las ventajas de Spleeter, en comparación con otros desarrollos en el área de separación de sonido, tales como el proyecto abierto , se menciona la utilización de modelos de mejor calidad, construidos sobre la base de una extensa colección de archivos sonoros. Debido a las limitaciones de derechos de autor, los investigadores en aprendizaje automático tienen acceso limitado a colecciones musicales públicas bastante escasas, mientras que para Spleeter los modelos se construyeron aprovechando datos de un extenso catálogo musical de Deezer.
Por Con Open-Unmix, Spleeter realiza la separación aproximadamente un 35% más rápido en pruebas con CPU, admite archivos MP3 y genera resultados notablemente de mayor calidad (al separar la voz en Open-Unmix se dejan huellas de algunos instrumentos, lo que probablemente se deba a que los modelos de Open-Unmix están entrenados con una colección de solo 150 composiciones).
Fuente: opennet.ru
