La version 1.6.0 du système de synthèse vocale open source RHVoice a été publiée. Initialement développée pour assurer un support de qualité de la langue russe, elle a ensuite été adaptée à d'autres langues, y compris l'anglais, le portugais, l'ukrainien, le kirghize, le tatar et le géorgien. Le code est écrit en C++ et est distribué sous la licence LGPL 2.1. Il est compatible avec GNU/Linux, Windows et Android. Le programme interagit avec les interfaces TTS standard pour convertir le texte en parole : SAPI5 (Windows), Speech Dispatcher (GNU/Linux) et l'API Text-to-Speech d'Android, mais peut également être utilisé avec le lecteur d'écran NVDA. L'auteur et développeur principal de RHVoice est Olga Yakovleva, qui poursuit le développement du projet malgré sa cécité totale.
La nouvelle version ajoute 5 nouvelles voix pour la parole russe. Le support de la langue albanaise a été implémenté. Le dictionnaire pour la langue ukrainienne a été mis à jour. Le support de la vocalisation des symboles emoji a été élargi. Des corrections de bogues ont été effectuées dans l'application pour la plateforme Android, facilitant l'importation de dictionnaires personnalisés, et le support de la plateforme Android 11 a été ajouté. De nouveaux paramètres et fonctionnalités ont été introduits dans le moteur, incluant g2p.case, word_break et le support de filtres d'égalisation.
Rappelons que RHVoice utilise les développements du projet HTS (Système de Synthèse Vocale basé sur HMM/DNN) et la méthode paramétrique de synthèse avec des modèles statistiques (Synthèse Paramétrique Statistique basée sur HMM - Modèle de Markov Caché). L'avantage du modèle statistique réside dans ses faibles frais généraux et sa faible exigence en puissance CPU. Toutes les opérations sont effectuées localement sur le système de l'utilisateur. Trois niveaux de qualité vocale sont supportés (plus la qualité est basse, plus la performance est élevée et le temps de réponse est réduit).
Le principal inconvénient du modèle statistique est la qualité de prononciation relativement faible, qui n'atteint pas le niveau des synthétiseurs générant de la parole à partir de combinaisons de fragments de discours naturel, mais néanmoins le résultat est assez intelligible et rappelle la diffusion d'un enregistrement par haut-parleur. En comparaison, le projet Silero, qui propose un moteur de synthèse vocale open-source basé sur des technologies d'apprentissage automatique et un ensemble de modèles pour la langue russe, surpasse RHVoice en qualité.
Pour la langue russe, 13 voix sont disponibles, tandis que pour l'anglais, il y en a 5. Les voix sont formées à partir d'enregistrements de la parole naturelle. Dans les paramètres, il est possible de modifier la vitesse, la hauteur et le volume. Une bibliothèque Sonic peut être utilisée pour changer le rythme. La détection automatique et le passage d'une langue à l'autre peuvent être effectués en analysant le texte d'entrée (par exemple, pour les mots et citations dans une autre langue, un modèle de synthèse natif pour cette langue peut être utilisé). Des profils vocaux sont pris en charge, définissant des combinaisons de voix pour différentes langues.
Source : opennet.ru
