Sortie du synthétiseur vocal RHVoice 1.8.0

La version 1.8.0 du système de synthèse vocale open source RHVoice a été publiée. À l'origine développée pour offrir un support de qualité pour la langue russe, elle a ensuite été adaptée pour d'autres langues, y compris l'anglais, le portugais, l'ukrainien, le kirghize, le tatare et le géorgien. Le code est écrit en C++ et distribué sous la licence LGPL 2.1. Il fonctionne sous GNU/Linux, Windows et Android. Le programme est compatible avec les interfaces TTS standard pour la conversion du texte en parole : SAPI5 (Windows), Speech Dispatcher (GNU/Linux) et l'API Text-To-Speech d'Android, mais peut également être utilisé dans le lecteur d'écran NVDA. La créatrice et principale développeuse de RHVoice est Olga Yakovleva, qui poursuit le développement du projet malgré sa cécité totale.

La version 1.8 pour la plateforme Android introduit un nouveau système de gestion des données vocales et linguistiques, permettant de télécharger des mises à jour des données vocales sans mettre à jour l'application mobile. La vérification de l'apparition de mises à jour pour les voix et langues ajoutées se fait automatiquement. De plus, cette nouvelle version prend en charge la langue polonaise et ajoute une nouvelle voix pour la langue macédonienne. La compatibilité avec les dernières versions alpha et bêta du lecteur d'écran NVDA est assurée. Des problèmes de compilation sur la plateforme Linux, qui se produisaient en l'absence de Speech Dispatcher, ont été résolus.

Rappelons que RHVoice utilise les développements du projet HTS (Système de Synthèse Vocale basé sur HMM/DNN) et la méthode paramétrique de synthèse avec des modèles statistiques (Synthèse Paramétrique Statistique basée sur HMM - Modèle de Markov Caché). L'avantage du modèle statistique réside dans ses faibles frais généraux et sa faible exigence en puissance CPU. Toutes les opérations sont effectuées localement sur le système de l'utilisateur. Trois niveaux de qualité vocale sont supportés (plus la qualité est basse, plus la performance est élevée et le temps de réponse est réduit).

Le principal inconvénient du modèle statistique est la qualité de prononciation relativement faible, qui n'atteint pas le niveau des synthétiseurs générant de la parole à partir de combinaisons de fragments de discours naturel, mais néanmoins le résultat est assez intelligible et rappelle la diffusion d'un enregistrement par haut-parleur. En comparaison, le projet Silero, qui propose un moteur de synthèse vocale open-source basé sur des technologies d'apprentissage automatique et un ensemble de modèles pour la langue russe, surpasse RHVoice en qualité.

Pour la langue russe, 14 voix sont disponibles, tandis que pour l'anglais, il y en a 6. Les voix sont générées à partir d'enregistrements de la parole naturelle. Dans les paramètres, il est possible de modifier la vitesse, la tonalité et le volume. La bibliothèque Sonic peut être utilisée pour changer le tempo. La détection automatique et le changement de langue peuvent être réalisés en analysant le texte d'entrée (par exemple, pour des mots et des citations dans une autre langue, le modèle de synthèse natif de cette langue peut être utilisé). Des profils vocaux sont pris en charge, définissant des combinaisons de voix pour différentes langues.

Source : opennet.ru

Acheter un hébergement fiable pour les sites avec protection DDoS, serveurs VPS VDS 🔥 Acheter un hébergement fiable pour les sites avec protection DDoS, serveurs VPS VDS | ProHoster