Veröffentlichung des Sprach­synthesizers RHVoice 1.6.0

Die offene Spracherzeugungssystem RHVoice 1.6.0 wurde veröffentlicht, die ursprünglich für die qualitativ hochwertige Unterstützung der russischen Sprache entwickelt wurde, dann aber auch für andere Sprachen, einschließlich Englisch, Portugiesisch, Ukrainisch, Kirgisisch, Tatarisch und Georgisch, angepasst wurde. Der Code ist in C++ geschrieben und wird unter der LGPL 2.1 Lizenz vertrieben. Es wird die Nutzung in GNU/Linux, Windows und Android unterstützt. Das Programm ist mit typischen TTS-Schnittstellen (Text-to-Speech) zur Umwandlung von Text in Sprache kompatibel: SAPI5 (Windows), Speech Dispatcher (GNU/Linux) und Android Text-To-Speech API, kann aber auch im Bildschirmleser NVDA verwendet werden. Die Schöpferin und Hauptentwicklerin von RHVoice ist Olga Jakovlew, die das Projekt trotz kompletter Blindheit weiterentwickelt.

In der neuen Version wurden 5 neue Sprachvarianten für die russische Sprache hinzugefügt. Die Unterstützung für die albanische Sprache wurde implementiert. Das Wörterbuch für die ukrainische Sprache wurde aktualisiert. Die Unterstützung für die Sprachausgabe von Emoji-Symbolen wurde erweitert. Es wurden Fehler im Android-Anwendungsübertragungsprozess behoben, der Import von benutzerdefinierten Wörterbüchern wurde vereinfacht, und die Unterstützung für die Plattform Android 11 wurde hinzugefügt. Neue Einstellungen und Funktionen, einschließlich g2p.case, word_break und die Unterstützung von Equalizer-Filtern, wurden zum Engine-Kern hinzugefügt.

Wir erinnern daran, dass in RHVoice die Erfahrungen des HTS-Projekts (HMM/DNN-basiertes Sprachsynthesesystem) und die parametrische Synthesemethode mit statistischen Modellen (Statistical Parametric Synthesis auf der Grundlage von HMM – Hidden Markov Model) verwendet werden. Der Vorteil des statistischen Modells ist die geringe Overhead und die geringe Anforderung an die CPU-Leistung. Alle Operationen werden lokal auf dem Nutzer-System ausgeführt. Es werden drei Qualitätsstufen der Sprache unterstützt (je niedriger die Qualität, desto höher die Leistung und kürzer die Reaktionszeit).

Der Nachteil des statistischen Modells ist die relativ niedrige Aussprachequalität, die nicht das Niveau von Synthesizern erreicht, die Sprache basierend auf der Kombination von Fragmenten natürlicher Sprache generieren, dennoch ist das Ergebnis durchaus verständlich und erinnert an die Übertragung einer Aufnahme über Lautsprecher. Zum Vergleich: Das Projekt Silero, das eine offene Engine für die Sprachsynthese auf Basis von Technologien des maschinellen Lernens und eine Modellreihe für die russische Sprache bereitstellt, übertrifft RHVoice in der Qualität.

Für die russische Sprache sind 13 Sprachvarianten verfügbar, für die englische Sprache 5. Die Stimmen basieren auf Aufzeichnungen natürlicher Sprache. In den Einstellungen kann die Geschwindigkeit, Höhe und Lautstärke geändert werden. Für die Änderung des Tempos kann die Sonic-Bibliothek verwendet werden. Es ist möglich, die Sprache automatisch zu bestimmen und zu wechseln, basierend auf der Analyse des eingegebenen Textes (zum Beispiel kann für Worte und Zitate in einer anderen Sprache das spezifische Sprachmodell verwendet werden). Sprachprofile, die Kombinationen von Stimmen für verschiedene Sprachen definieren, werden unterstützt.

Quelle: opennet.ru

60GB SSD 8Gb DDR4