Le groupe d'entreprises CRT, faisant partie de l'écosystème de Sberbank, a annoncé le développement d'une plateforme avancée de synthèse vocale, qui, selon les dires, garantit fluidité et expressivité dans la lecture de tout texte.
La solution présentée est la troisième génération du système de synthèse vocale. Un signal audio de haute qualité est généré par des modèles de réseaux neuronaux complexes. Les développeurs affirment que le résultat de ces algorithmes est la synthèse de la parole russophone la plus réaliste.

La plateforme comprend un module de prédiction des accents dans les mots qui ne figurent pas encore dans le dictionnaire de base. De plus, elle prévoit la correction automatique des erreurs orthographiques courantes. Grâce à une analyse linguistique approfondie du texte, la prononciation sera conforme aux normes de la langue même dans les cas difficiles.
Un autre avantage de la plateforme est qu'elle ne nécessite pas de matériel coûteux serveurs, équipé d'accélérateurs GPU. La technologie peut être utilisée de deux manières : via un service cloud ou intégrée dans une solution propre.

Parmi les domaines d'application possibles de cette innovation figurent les chatbots et assistants vocaux, les services d'information et d'alerte, ainsi que les services vocaux avec synthèse instantanée de tout texte durant un appel, etc.
« Dans les scénarios automatisés de communication avec les clients, cette technologie permet d'interagir de manière individuelle avec chaque abonné, car il n'y a pas de messages fixes et tout texte peut être synthétisé en cours d'appel », affirment les développeurs.
Il est possible de tester la technologie .
Source : 3dnews.ru
