Dostawca strumieniowego przesyłania Deezer pierwotne teksty eksperymentalnego projektu Spleeter, rozwijającego system uczenia maszynowego do separacji źródeł dźwięku z złożonych kompozycji dźwiękowych. Program pozwala na usunięcie wokalu z kompozycji i pozostawienie jedynie podkładu muzycznego, manipulację brzmieniem poszczególnych instrumentów lub odrzucenie muzyki i pozostawienie głosu do nałożenia na inny ślad dźwiękowy, tworzenia miksów, karaoke lub transkrypcji. Kod projektu napisany jest w języku Python z wykorzystaniem silnika Tensorflow i na licencji MIT.
Do pobrania już wytrenowane modele do oddzielania wokalu (jednego głosu) od akompaniamentu, a także do separacji na 4 i 5 śladów, obejmujących wokal, perkusję, bas, pianino i pozostały dźwięk. Spleeter może być stosowany zarówno jako biblioteka Python, jak i w formie osobnego narzędzia wiersza poleceń. W najprostszej wersji, na podstawie pliku źródłowego dwa, cztery lub pięć plików z głosem i składnikami akompaniamentu (vocals.wav, drums.wav, bass.wav, piano.wav, other.wav).
Podczas separacji na 2 i 4 ślady Spleeter zapewnia bardzo wysoką wydajność; na przykład, przy użyciu GPU, dzielenie pliku dźwiękowego na 4 ślady zajmuje 100 razy mniej czasu niż czas trwania źródłowej kompozycji. Na systemie z GPU NVIDIA GeForce GTX 1080 i 32-rdzeniowym CPU Intel Xeon Gold 6134 przetwarzanie testowego zbioru musDB, mającego długość trzy godziny 27 minut, zostało wykonane w 90 sekund.
Z zalet Spleeter w porównaniu do innych rozwiązań w dziedzinie separacji dźwięku, takich jak otwarty projekt , wymienia się zastosowanie wyższej jakości modeli, zbudowanych na podstawie rozległej kolekcji plików dźwiękowych. Z powodu ograniczeń praw autorskich naukowcy zajmujący się uczeniem maszynowym mają ograniczony dostęp do stosunkowo skromnych ogólnodostępnych zbiorów plików muzycznych, podczas gdy dla Spleeter modele zostały zbudowane z wykorzystaniem danych z obszernego katalogu muzycznego Deezer.
Według Z Open-Unmix narzędzie Spleeter wykonuje podział o około 35% szybciej w testach na CPU, obsługuje pliki MP3 i generuje wyraźnie wyższej jakości rezultaty (przy wydzielaniu głosu w Open-Unmix pozostają ślady niektórych instrumentów, co prawdopodobnie wynika z tego, że modele Open-Unmix były trenowane na zbiorze 150 utworów).
Źródło: opennet.ru
