Otwarty kod Spleeter, systemu do separacji muzyki i głosu

Dostawca strumieniowego przesyłania Deezer otworzył pierwotne teksty eksperymentalnego projektu Spleeter, rozwijającego system uczenia maszynowego do separacji źródeł dźwięku z złożonych kompozycji dźwiękowych. Program pozwala na usunięcie wokalu z kompozycji i pozostawienie jedynie podkładu muzycznego, manipulację brzmieniem poszczególnych instrumentów lub odrzucenie muzyki i pozostawienie głosu do nałożenia na inny ślad dźwiękowy, tworzenia miksów, karaoke lub transkrypcji. Kod projektu napisany jest w języku Python z wykorzystaniem silnika Tensorflow i rozpowszechniany na licencji MIT.

Do pobrania są oferowane już wytrenowane modele do oddzielania wokalu (jednego głosu) od akompaniamentu, a także do separacji na 4 i 5 śladów, obejmujących wokal, perkusję, bas, pianino i pozostały dźwięk. Spleeter może być stosowany zarówno jako biblioteka Python, jak i w formie osobnego narzędzia wiersza poleceń. W najprostszej wersji, na podstawie pliku źródłowego tworzy dwa, cztery lub pięć plików z głosem i składnikami akompaniamentu (vocals.wav, drums.wav, bass.wav, piano.wav, other.wav).

Podczas separacji na 2 i 4 ślady Spleeter zapewnia bardzo wysoką wydajność; na przykład, przy użyciu GPU, dzielenie pliku dźwiękowego na 4 ślady zajmuje 100 razy mniej czasu niż czas trwania źródłowej kompozycji. Na systemie z GPU NVIDIA GeForce GTX 1080 i 32-rdzeniowym CPU Intel Xeon Gold 6134 przetwarzanie testowego zbioru musDB, mającego długość trzy godziny 27 minut, zostało wykonane w 90 sekund.

Otwarty kod Spleeter, systemu do separacji muzyki i głosu



Z zalet Spleeter w porównaniu do innych rozwiązań w dziedzinie separacji dźwięku, takich jak otwarty projekt Open-Unmix, wymienia się zastosowanie wyższej jakości modeli, zbudowanych na podstawie rozległej kolekcji plików dźwiękowych. Z powodu ograniczeń praw autorskich naukowcy zajmujący się uczeniem maszynowym mają ograniczony dostęp do stosunkowo skromnych ogólnodostępnych zbiorów plików muzycznych, podczas gdy dla Spleeter modele zostały zbudowane z wykorzystaniem danych z obszernego katalogu muzycznego Deezer.

Według w porównaniu Z Open-Unmix narzędzie Spleeter wykonuje podział o około 35% szybciej w testach na CPU, obsługuje pliki MP3 i generuje wyraźnie wyższej jakości rezultaty (przy wydzielaniu głosu w Open-Unmix pozostają ślady niektórych instrumentów, co prawdopodobnie wynika z tego, że modele Open-Unmix były trenowane na zbiorze 150 utworów).

Źródło: opennet.ru

Kup solidny hosting stron z ochroną przed DDoS, serwery VPS VDS 🔥 Kup solidny hosting stron z ochroną przed DDoS, serwery VPS VDS | ProHoster