Le fournisseur de streaming Deezer les codes sources du projet expérimental Spleeter, qui développe un système d'apprentissage automatique pour séparer les sources sonores des compositions musicales complexes. Le programme permet de retirer la voix d'une composition tout en conservant uniquement l'accompagnement musical, de manipuler le son d'instruments individuels ou de supprimer la musique pour ne conserver que la voix, afin de la superposer à une autre piste audio, de créer des mixages, du karaoké ou des transcriptions. Le code du projet est écrit en Python en utilisant le moteur Tensorflow et sous licence MIT.
Pour charger des modèles déjà entraînés pour séparer la voix (une seule voix) de l'accompagnement, ainsi que pour la séparation en 4 et 5 flux, incluant la voix, les batteries, les basse, le piano et d'autres sons. Spleeter peut être utilisé comme une bibliothèque Python ou comme un utilitaire autonome en ligne de commande. Dans le cas le plus simple, à partir d'un fichier source deux, quatre ou cinq fichiers contenant la voix et les éléments de l'accompagnement (vocals.wav, drums.wav, bass.wav, piano.wav, other.wav).
Lors de la séparation en 2 et 4 flux, Spleeter assure une très haute performance. Par exemple, lorsqu'un GPU est utilisé, la séparation d'un fichier audio en 4 flux prend 100 fois moins de temps que la durée de la composition originale. Sur un système avec un GPU NVIDIA GeForce GTX 1080 et un CPU Intel Xeon Gold 6134 à 32 cœurs, le traitement d'une collection de test musDB, d'une durée de trois heures et 27 minutes, a été réalisé en 90 secondes.
Parmi les avantages de Spleeter, par rapport à d'autres développements dans le domaine de la séparation du son, tels que le projet ouvert , on mentionne l'utilisation de modèles de meilleure qualité, construits sur la base d'une vaste collection de fichiers sonores. En raison des restrictions liées aux droits d'auteur, les chercheurs en apprentissage automatique ont un accès limité à des collections d'œuvres musicales publiques plutôt rares, tandis que pour Spleeter, les modèles ont été construits en utilisant des données d'un large catalogue musical de Deezer.
Selon Avec Open-Unmix, l'outil Spleeter réalise la séparation environ 35 % plus rapidement lors des tests sur CPU, prend en charge les fichiers MP3 et génère un résultat de qualité nettement supérieure (en isolant la voix, Open-Unmix laisse des traces de certains instruments, probablement parce que les modèles d'Open-Unmix ont été entraînés sur un ensemble de 150 compositions).
Source : opennet.ru
