Nowa wersja systemu syntezatora mowy Silero

Dostępna jest nowa publiczna wersja systemu syntezatora mowy Silero Text-to-Speech. Projekt koncentruje się na stworzeniu nowoczesnego, wysokiej jakości systemu syntezatora mowy, który nie ustępuje rozwiązaniom komercyjnym od korporacji i jest dostępny dla wszystkich zainteresowanych bez potrzeby korzystania z drogiego sprzętu serwerowego.

Modele są dystrybuowane na licencji GNU AGPL, ale firma rozwijająca projekt nie ujawnia mechanizmu szkolenia modeli. Do uruchomienia można wykorzystać PyTorch oraz frameworki wspierające format ONNX. Syntezę mowy w Silero oparto na głębokich, zmodyfikowanych nowoczesnych algorytmach sieci neuronowych oraz metodach cyfrowego przetwarzania sygnałów.

Zauważono, że głównym problemem współczesnych rozwiązań sieci neuronowych do syntezowania mowy jest to, że są zazwyczaj dostępne wyłącznie w ramach płatnych rozwiązań chmurowych, a produkty publiczne mają wysokie wymagania sprzętowe, niższą jakość lub nie są kompletne i gotowe do użycia. Na przykład, aby bezproblemowo uruchomić jedno z nowych popularnych architektur end-to-end syntezy, VITS, w trybie syntezy (to znaczy, nie do szkolenia modeli), wymagane są karty graficzne z ponad 16 gigabajtami VRAM.

Wbrew panującemu trendowi rozwiązania Silero działają nawet na 1 wątku procesora Intel x86 z instrukcjami AVX2. Na 4 wątkach procesora syntezator pozwala na syntezę od 30 do 60 sekund na sekundę przy częstotliwości 8 kHz, w trybie 24 kHz — 15-20 sek., a w trybie 48 kHz — około 10 sek.

Główne cechy nowej wersji Silero:

  • Rozmiar modelu został zmniejszony dwukrotnie do 50 megabajtów;
  • Modele potrafią robić pauzy;
  • Dostępne są 4 wysokiej jakości głosy w języku rosyjskim (i nieskończona liczba przypadkowych). Przykłady wymowy;
  • Modele stały się 10 razy szybsze i na przykład w trybie 24 kHz umożliwiają syntezę do 20 sekund audio na sekundę przy 4 wątkach procesora;
  • Wszystkie warianty głosów dla jednego języka są zapakowane w jeden model;
  • Modele mogą przyjmować całe akapity tekstu jako wejście, wspierają tagi SSML;
  • Syntezator działa natychmiast w trzech częstotliwościach próbkowania do wyboru — 8, 24 i 48 kHz;
  • Rozwiązano 'dziecięce problemy': niestabilność i pomijanie słów;
  • Dodano flagi do kontroli automatycznego wstawiania akcentów oraz wstawiania litery 'ё'.

Obecnie dla najnowszej wersji syntezatora dostępne są publicznie 4 głosy w języku rosyjskim, ale w najbliższej przyszłości zostanie opublikowana kolejna wersja z następującymi zmianami:

  • Prędkość syntezatora wzrośnie jeszcze 2-4 razy;
  • Modele syntezatora dla języków WNP: kalmuckiego, tatarskiego, uzbeckiego i ukraińskiego zostaną zaktualizowane;
  • Zostaną dodane modele dla języków europejskich;
  • Zostaną dodane modele dla języków indyjskich;
  • Zostaną dodane modele dla języka angielskiego.

Niektóre z problemów systemowych związanych z syntezatorem Silero:

  • W przeciwieństwie do bardziej tradycyjnych rozwiązań syntezatorskich, takich jak RHVoice, syntezator Silero nie ma integracji z SAPI, prostych klientów do instalacji oraz integracji dla systemów Windows i Android;
  • Prędkość, choć niezwykle wysoka jak na to rozwiązanie, może być niewystarczająca do syntezowania w czasie rzeczywistym na słabych procesorach w wysokiej jakości;
  • Rozwiązanie do automatycznego akcentowania nie obsługuje homonimów (słów takich jak zAmok i zamOk) i wciąż popełnia błędy, ale ta wada zostanie naprawiona w przyszłych wydaniach;
  • Aktualna wersja syntezatora nie działa na procesorach bez instrukcji AVX2 (lub konieczne jest specjalne dostosowanie ustawień PyTorch), ponieważ jeden z modułów wewnątrz modelu został skwantyzowany;
  • Aktualna wersja syntezatora ma zasadniczo jedyną zależność w postaci PyTorch, cały kod jest "zaszyty" wewnątrz modelu i pakietów JIT. Źródła modeli nie są publikowane, tak samo jak kod do uruchamiania modeli z klientów PyTorch dla innych języków;
  • Libtorch, dostępny na platformy mobilne, jest znacznie bardziej skomplikowany niż ONNX runtime, ale wersja modelu w formacie ONNX nie jest jeszcze dostępna.

Źródło: opennet.ru

Kup solidny hosting stron z ochroną przed DDoS, serwery VPS VDS 🔥 Kup solidny hosting stron z ochroną przed DDoS, serwery VPS VDS | ProHoster