Wydano otwarty system syntezatora mowy RHVoice 1.6.0, pierwotnie rozwijany w celu zapewnienia wysokiej jakości wsparcia języka rosyjskiego, ale później dostosowany także do innych języków, w tym angielskiego, portugalskiego, ukraińskiego, kirgińskiego, tatarskiego i gruzińskiego. Kod napisany jest w C++ i jest rozpowszechniany na licencji LGPL 2.1. Obsługiwane są platformy GNU/Linux, Windows i Android. Program jest kompatybilny z typowymi interfejsami TTS (text-to-speech) do zamiany tekstu na mowę: SAPI5 (Windows), Speech Dispatcher (GNU/Linux) oraz Android Text-To-Speech API, ale może być także używany w czytniku ekranu NVDA. Twórcą i głównym deweloperem RHVoice jest Olga Jakowlewa, która rozwija projekt mimo całkowitej ślepoty.
W nowej wersji dodano 5 nowych wariantów głosów dla mowy w języku rosyjskim. Zrealizowano wsparcie dla języka albańskiego. Zaktualizowano słownik dla języka ukraińskiego. Rozszerzono wsparcie dla odczytu symboli emoji. Przeprowadzono prace nad usunięciem błędów w aplikacji na platformę Android, uproszczono import użytkowniczych słowników, a także dodano wsparcie dla systemu Android 11. Do rdzenia silnika dodano nowe ustawienia i funkcjonalności, w tym g2p.case, word_break oraz wsparcie dla filtrów equalizacji.
Przypominamy, że w RHVoice zastosowane są osiągnięcia projektu HTS (HMM/DNN-based Speech Synthesis System) oraz parametryczna metoda syntezy ze statystycznymi modelami (Statistical Parametric Synthesis oparte na HMM — ukryty model Markowa). Plusem modelu statystycznego są niskie koszty obliczeniowe i małe wymagania dotyczące mocy CPU. Wszystkie operacje są wykonywane lokalnie w systemie użytkownika. Wsparcie zapewnia trzy poziomy jakości mowy (im niższa jakość — tym wyższa wydajność i krótszy czas reakcji).
Minusem modelu statystycznego jest stosunkowo niska jakość wymowy, która nie osiąga poziomu syntezatorów generujących mowę na podstawie kombinacji fragmentów naturalnej mowy, ale mimo to wynik jest całkiem zrozumiały i przypomina transmisję nagrania z głośnika. Dla porównania, projekt Silero, oferujący otwarty silnik do syntezy mowy oparty na technologiach uczenia maszynowego i zestawie modeli dla języka rosyjskiego, przewyższa jakością RHVoice.
Dla języka polskiego dostępnych jest 13 wariantów głosów, a dla języka angielskiego — 5. Głosy tworzone są na podstawie nagrań naturalnej mowy. W ustawieniach można zmieniać tempo, wysokość i głośność. Do zmiany tempa może być stosowana biblioteka Sonic. Możliwe jest automatyczne rozpoznawanie i przełączanie języka na podstawie analizy wprowadzonego tekstu (na przykład dla słów i cytatów w innym języku może być używany model syntezy rodzimy dla danego języka). Wspierane są profile głosowe, które określają kombinacje głosów dla różnych języków.
Źródło: opennet.ru
