Została wydana otwarta system syntezatorów mowy RHVoice 1.8.0, pierwotnie rozwijana w celu zapewnienia wysokiej jakości wsparcia języka rosyjskiego, ale następnie dostosowana również do innych języków, w tym angielskiego, portugalskiego, ukraińskiego, kirgiskiego, tatarskiego i gruzińskiego. Kod jest napisany w C++ i jest rozpowszechniany na licencji LGPL 2.1. Obsługiwane są systemy GNU/Linux, Windows i Android. Program jest zgodny z typowymi interfejsami TTS (text-to-speech) do przekształcania tekstu na mowę: SAPI5 (Windows), Speech Dispatcher (GNU/Linux) oraz Android Text-To-Speech API, ale może być także używany w czytniku ekranu NVDA. Twórcą i głównym deweloperem RHVoice jest Olga Jakowlewa, która rozwija projekt mimo całkowitej utraty wzroku.
W wersji 1.8 dla platformy Android wprowadzono nowy system zarządzania danymi głosowymi i językowymi, umożliwiający ładowanie aktualizacji danych głosowych bez aktualizacji aplikacji mobilnej. Sprawdzanie dostępności aktualizacji danych dla dodanych głosów i języków odbywa się automatycznie. Ponadto, w nowej wersji zaimplementowano wsparcie dla języka polskiego oraz dodano nowy głos dla języka macedońskiego. Zapewniono kompatybilność z nowymi wersjami alfa i beta czytnika ekranu NVDA. Naprawiono problemy z kompilacją na platformie Linux, które występowały w przypadku braku Speech Dispatcher.
Przypominamy, że w RHVoice zastosowane są osiągnięcia projektu HTS (HMM/DNN-based Speech Synthesis System) oraz parametryczna metoda syntezy ze statystycznymi modelami (Statistical Parametric Synthesis oparte na HMM — ukryty model Markowa). Plusem modelu statystycznego są niskie koszty obliczeniowe i małe wymagania dotyczące mocy CPU. Wszystkie operacje są wykonywane lokalnie w systemie użytkownika. Wsparcie zapewnia trzy poziomy jakości mowy (im niższa jakość — tym wyższa wydajność i krótszy czas reakcji).
Minusem modelu statystycznego jest stosunkowo niska jakość wymowy, która nie osiąga poziomu syntezatorów generujących mowę na podstawie kombinacji fragmentów naturalnej mowy, ale mimo to wynik jest całkiem zrozumiały i przypomina transmisję nagrania z głośnika. Dla porównania, projekt Silero, oferujący otwarty silnik do syntezy mowy oparty na technologiach uczenia maszynowego i zestawie modeli dla języka rosyjskiego, przewyższa jakością RHVoice.
Dla języka rosyjskiego dostępnych jest 14 wariantów głosów, dla angielskiego — 6. Głosy są generowane na podstawie nagrań naturalnej mowy. W ustawieniach można zmieniać prędkość, wysokość i głośność. Do zmiany tempa można używać biblioteki Sonic. Możliwe jest automatyczne rozpoznawanie i przełączanie języka na podstawie analizy wprowadzonego tekstu (na przykład, dla słów i cytatów w innym języku można użyć modelu syntezy naturalnego dla danego języka). Obsługiwane są profile głosowe, które definiują kombinacje głosów dla różnych języków.
Źródło: opennet.ru
