Die Veröffentlichung des offenen Sprachsynthesesystems RHVoice 1.8.0 fand statt, das ursprünglich zur qualitativ hochwertigen Unterstützung der russischen Sprache entwickelt wurde, dann jedoch auch für andere Sprachen, einschließlich Englisch, Portugiesisch, Ukrainisch, Kirgisisch, Tatarisch und Georgisch, angepasst wurde. Der Code ist in C++ geschrieben und unter der Lizenz LGPL 2.1 verfügbar. Es wird die Arbeit unter GNU/Linux, Windows und Android unterstützt. Das Programm ist mit typischen TTS-Schnittstellen (Text-to-Speech) zur Umwandlung von Text in Sprache kompatibel: SAPI5 (Windows), Speech Dispatcher (GNU/Linux) und Android Text-To-Speech API und kann auch in dem Bildschirmleser NVDA verwendet werden. Die Schöpferin und Hauptentwicklerin von RHVoice ist Olga Jakowlewa, die das Projekt trotz vollständiger Blindheit weiterentwickelt.
In der Version 1.8 für die Android-Plattform wurde ein neues System zur Verwaltung von Sprach- und Sprachdaten eingeführt, das es ermöglicht, Sprachdaten-Updates herunterzuladen, ohne die mobile Anwendung zu aktualisieren. Die Überprüfung auf Updates für hinzugefügte Stimmen und Sprachen erfolgt automatisch. Darüber hinaus wird in der neuen Veröffentlichung die Unterstützung für die polnische Sprache umgesetzt und eine neue Stimme für die mazedonische Sprache hinzugefügt. Die Kompatibilität mit den neuesten Alpha- und Betaversionen des Bildschirmlesers NVDA wurde gewährleistet. Probleme beim Erstellen auf der Linux-Plattform, die bei Fehlen des Speech Dispatchers auftraten, wurden behoben.
Wir erinnern daran, dass in RHVoice die Erfahrungen des HTS-Projekts (HMM/DNN-basiertes Sprachsynthesesystem) und die parametrische Synthesemethode mit statistischen Modellen (Statistical Parametric Synthesis auf der Grundlage von HMM – Hidden Markov Model) verwendet werden. Der Vorteil des statistischen Modells ist die geringe Overhead und die geringe Anforderung an die CPU-Leistung. Alle Operationen werden lokal auf dem Nutzer-System ausgeführt. Es werden drei Qualitätsstufen der Sprache unterstützt (je niedriger die Qualität, desto höher die Leistung und kürzer die Reaktionszeit).
Der Nachteil des statistischen Modells ist die relativ niedrige Aussprachequalität, die nicht das Niveau von Synthesizern erreicht, die Sprache basierend auf der Kombination von Fragmenten natürlicher Sprache generieren, dennoch ist das Ergebnis durchaus verständlich und erinnert an die Übertragung einer Aufnahme über Lautsprecher. Zum Vergleich: Das Projekt Silero, das eine offene Engine für die Sprachsynthese auf Basis von Technologien des maschinellen Lernens und eine Modellreihe für die russische Sprache bereitstellt, übertrifft RHVoice in der Qualität.
Für die russische Sprache stehen 14 Stimmen zur Verfügung, für die englische 6. Die Stimmen basieren auf Aufzeichnungen natürlicher Sprache. In den Einstellungen können Geschwindigkeit, Tonhöhe und Lautstärke angepasst werden. Zur Änderung des Tempos kann die Sonic-Bibliothek verwendet werden. Es ist möglich, die Sprache automatisch zu erkennen und basierend auf der Analyse des eingegebenen Textes umzuschalten (zum Beispiel kann für Wörter und Zitate in einer anderen Sprache das native Synthesemodell dieser Sprache verwendet werden). Sprachprofile werden unterstützt, die Sprachkombinationen für verschiedene Sprachen definieren.
Quelle: opennet.ru
