Veröffentlichung des Sprachsynthesizers RHVoice 1.6.0

Die offene Sprachsynthese-Plattform RHVoice 1.6.0 wurde veröffentlicht. Ursprünglich für die qualitativ hochwertige Unterstützung der russischen Sprache entwickelt, wurde sie später auch für andere Sprachen adaptiert, darunter Englisch, Portugiesisch, Ukrainisch, Kirgisisch, Tatarisch und Georgisch. Der Code ist in C++ geschrieben und wird unter der LGPL 2.1-Lizenz vertrieben. Es wird Unterstützung für GNU/Linux, Windows und Android angeboten. Das Programm ist mit gängigen TTS-Schnittstellen (Text-to-Speech) zur Umwandlung von Text in Sprache kompatibel: SAPI5 (Windows), Speech Dispatcher (GNU/Linux) und Android Text-To-Speech API, kann jedoch auch im Screenreader NVDA verwendet werden. Die Schöpferin und Hauptentwicklerin von RHVoice ist Olga Jakowlewa, die das Projekt trotz vollständiger Erblindung weiterführt.

In der neuen Version wurden 5 neue Sprachvarianten für die russische Sprache hinzugefügt. Unterstützung für die albanische Sprache wurde implementiert. Das Wörterbuch für die ukrainische Sprache wurde aktualisiert. Die Unterstützung für die Sprachsynthese von Emoji-Symbolen wurde erweitert. Darüber hinaus wurden Fehler im Android-Anwendung behoben, der Import benutzerdefinierter Wörterbücher vereinfacht und Unterstützung für Android 11 hinzugefügt. Das Kernsystem des Engines erhielt neue Einstellungen und Funktionen, darunter g2p.case, word_break und Unterstützung für Equalizer-Filter.

Wir möchten daran erinnern, dass in RHVoice die Entwicklungen des HTS-Projekts (HMM/DNN-basiertes Sprachsynthesesystem) und die parametrische Synthesemethode mit statistischen Modellen (Statistical Parametric Synthesis basierend auf HMM — Hidden Markov Model) angewendet werden. Der Vorteil des statistischen Modells sind die geringen Overheads und die geringe Anforderung an die CPU-Leistung. Alle Operationen werden lokal auf dem System des Benutzers ausgeführt. Es werden drei Qualitätsstufen für die Sprachausgabe unterstützt (je niedriger die Qualität, desto höher die Leistung und kürzer die Reaktionszeit).

Ein Nachteil des statistischen Modells ist die relativ niedrige Sprachqualität, die nicht das Niveau von Synthesizern erreicht, die Sprache auf Basis von Kombinationen natürlicher Sprachfragmente generieren. Dennoch ist das Ergebnis recht verständlich und erinnert an die Übertragung einer Aufnahme über einen Lautsprecher. Zum Vergleich: Das Silero-Projekt bietet eine offene Engine für Sprachsynthese, die auf Technologien des maschinellen Lernens basiert, sowie eine Modellreihe für die russische Sprache, die in puncto Qualität RHVoice übertrifft.

Für die russische Sprache sind 13 Sprachvarianten verfügbar, für die englische Sprache 5. Die Stimmen basieren auf Aufnahmen natürlicher Sprache. In den Einstellungen können Geschwindigkeit, Tonhöhe und Lautstärke angepasst werden. Zur Änderung des Tempos kann die Sonic-Bibliothek verwendet werden. Eine automatische Spracherkennung und -umschaltung ist basierend auf der Analyse des eingehenden Textes möglich (beispielsweise kann für Wörter und Zitate in einer anderen Sprache das native Synthesemodell dieser Sprache verwendet werden). Unterstützt werden Sprachprofile, die Kombinationen von Stimmen für verschiedene Sprachen definieren.

Quelle: opennet.ru

Kaufen Sie zuverlässiges Hosting für Websites mit DDoS-Schutz, VPS VDS-Server 🔥 Kaufen Sie zuverlässiges Hosting für Websites mit DDoS-Schutz, VPS VDS-Server | ProHoster