Die Veröffentlichung von RHVoice 1.2.4, einem offenen Sprachsynthesesystem, das ursprünglich zur Unterstützung der russischen Sprache entwickelt wurde, dann aber auch für andere Sprachen wie Englisch, Portugiesisch, Ukrainisch, Kirgisisch, Tatarisch und Georgisch angepasst wurde, wurde veröffentlicht. Der Code ist in C++ geschrieben und unter der LGPL 2.1 Lizenz verfügbar. Es wird die Verwendung in GNU/Linux, Windows und Android unterstützt. Das Programm ist mit den Standard-TTS-Interfaces (Text-to-Speech) zur Umwandlung von Text in Sprache kompatibel: SAPI5 (Windows), Speech Dispatcher (GNU/Linux) und Android Text-To-Speech API, kann aber auch mit dem Screenreader NVDA verwendet werden.
Das Programm verwendet eine parametrische Synthesemethode mit statistischen Modellen (Statistical Parametric Synthesis auf Basis von HMM — Hidden Markov Model). Ein Vorteil des statistischen Modells sind die geringen Betriebskosten und die geringe CPU-Anforderung. Alle Operationen werden lokal auf dem System des Benutzers ausgeführt. Es werden drei Qualitätsstufen der Sprache unterstützt (je niedriger die Qualität, desto höher die Leistung und kürzer die Reaktionszeit).
Die Anpassung und der Wechsel der Stimmen werden unterstützt. Für die russische Sprache stehen 9 Sprachvarianten zur Verfügung, für die englische Sprache 5. Die Stimmen basieren auf Aufnahmen natürlicher Sprache. Aufgrund des Einsatzes des statistischen Modells erreicht die Aussprachequalität nicht das Niveau von Synthesizern, die Sprache auf Grundlage von Kombinationen natürlicher Sprachfragmente generieren, jedoch ist das Ergebnis durchaus verständlich und erinnert an eine Übertragung von einer Lautsprecheraufnahme.
In den Einstellungen können Geschwindigkeit, Tonhöhe und Lautstärke geändert werden. Zur Änderung des Tempos kann die Sonic-Bibliothek verwendet werden. Es ist möglich, die Sprache automatisch zu bestimmen und zu wechseln, basierend auf der Analyse des Eingabetextes (zum Beispiel können für Wörter und Zitate in einer anderen Sprache die für diese Sprache nativen Synthesemodelle verwendet werden). Sprachprofile werden unterstützt, die Kombinationen von Stimmen für verschiedene Sprachen definieren.
Quelle: opennet.ru
