Firma Zyphra wydała pierwszy beta-wydanie modelu AI do syntezę mowy Zonos na licencji Apache 2.0. Narzędzie oferowane razem z modelem obsługuje funkcję klonowania głosu, umożliwiającą syntezę mowy pożądanym głosem, dla którego model potrzebuje jedynie 30-sekundowego wzorcowego nagrania mowy mówcy. Obsługiwane są języki angielski, japoński, chiński, francuski i niemiecki.
Model obejmuje 1,6 miliarda parametrów i został wytrenowany na 200 tysiącach godzin nagrań audio. Obsługiwane są zarówno synteza monofoniczna (jak w audiobookach), jak i emocjonalna (jak w żywej rozmowie), a także synteza na podstawie zadanego prefiksu (podawane jest nagranie z początkiem mowy, na podstawie którego model syntezuje kontynuację według podanego tekstu, reprodukując oryginalne cechy mowy, na przykład kontynuując szeptem).
Na wyjściu generowany jest dźwięk o częstości próbkowania 44 kHz. Obsługiwana jest zamiana syntezowanych wstawek w celu symulacji wystąpień kilku mówców lub budowania interaktywnych dialogów, a także dodawanie znaczników do kontrolowania prędkości mowy, tonacji i wyrażania emocji, takich jak radość, strach, smutek i złość.
Według zapewnień twórców, jakość generowanej mowy nie ustępuje ani nie jest gorsza niż wszystkie publicznie dostępne otwarte i komercyjne systemy syntezy (w testach porównywano ją z ElevenLabs, Cartesia i FishSpeech). Do wad zalicza się wyższą koncentrację artefaktów dźwiękowych, takich jak kaszel, dźwięk oddechu lub skrzypienie, na początku lub na końcu generowanego materiału dźwiękowego.
- Zonos:
- ElevenLabs:
- Cartesia:
- Fish Speech v1.5:
- ElevenLabs:
Aby skorzystać z modelu w swoim systemie, przygotowano gotowy obraz do pracy dla systemu Docker, który zawiera interfejs webowy do zarządzania syntezą, oparty na platformie Gradio. Aby rozpocząć pracę, wystarczy zainstalować obraz komendą „git clone https://github.com/Zyphra/Zonos.git; cd Zonos; docker compose up” i otworzyć w przeglądarce stronę „http://localhost:7860”. Zaleca się posiadanie GPU NVIDIA serii 3000 z minimum 6 GB pamięci wideo. Wydajność pracy na systemie z GPU RTX 4090 jest dwukrotnie większa niż wymagana do syntezy w czasie rzeczywistym.

Źródło: opennet.ru
