Lanzamiento del sintetizador de voz RHVoice 1.8.0

Se lanzó la versión 1.8.0 del sistema de síntesis de voz de código abierto RHVoice, que se desarrolló inicialmente para proporcionar un soporte de calidad para el idioma ruso, pero luego se adaptó también a otros idiomas, incluidos el inglés, portugués, ucraniano, kirguís, tártaro y georgiano. El código está escrito en C++ y se distribuye bajo la licencia LGPL 2.1. Es compatible con GNU/Linux, Windows y Android. El programa es compatible con las interfaces TTS estándar (text-to-speech) para convertir texto en voz: SAPI5 (Windows), Speech Dispatcher (GNU/Linux) y Android Text-To-Speech API, pero también puede ser utilizado en el lector de pantalla NVDA. La creadora y desarrolladora principal de RHVoice es Olga Yakovleva, quien sigue desarrollando el proyecto a pesar de ser completamente ciega.

En la versión 1.8 para la plataforma Android se ofrece un nuevo sistema de gestión de datos de voz y lengua, que permite cargar actualizaciones de datos de voz sin necesidad de actualizar la aplicación móvil. La verificación de la disponibilidad de actualizaciones de datos para las voces y lenguas añadidas se realiza automáticamente. Además, esta nueva versión implementa soporte para el idioma polaco y se añade una nueva voz para el idioma macedonio. Se garantiza la compatibilidad con las versiones alfa y beta más recientes del lector de pantalla NVDA. Se han solucionado problemas de compilación en la plataforma Linux que ocurrían en ausencia de Speech Dispatcher.

Cabe recordar que en RHVoice se utilizan los desarrollos del proyecto HTS (HMM/DNN-based Speech Synthesis System) y el método paramétrico de síntesis con modelos estadísticos (Statistical Parametric Synthesis basado en HMM - Hidden Markov Model). La ventaja del modelo estadístico es el bajo consumo de recursos y la no exigencia de potencia de CPU. Todas las operaciones se realizan de forma local en el sistema del usuario. Se soportan tres niveles de calidad de voz (cuanto menor es la calidad, mayor es el rendimiento y menor es el tiempo de respuesta).

Una desventaja del modelo estadístico es la calidad de pronunciación relativamente baja, que no alcanza el nivel de los sintetizadores que generan voz en base a la combinación de fragmentos de voz natural, pero aun así el resultado es bastante comprensible y recuerda a la transmisión de una grabación a través de un altavoz. En comparación, el proyecto Silero, que proporciona un motor de síntesis de voz abierto basado en tecnologías de aprendizaje automático y un conjunto de modelos para el idioma ruso, supera en calidad a RHVoice.

Para el idioma ruso, hay 14 opciones de voz disponibles, y para el inglés, 6. Las voces se generan a partir de grabaciones de habla natural. En la configuración, se puede modificar la velocidad, la altura y el volumen. Para cambiar el ritmo, se puede utilizar la biblioteca Sonic. Es posible la detección automática y el cambio de idioma basado en el análisis del texto de entrada (por ejemplo, para palabras y citas en otro idioma, se puede usar el modelo de síntesis nativo de ese idioma). Se admiten perfiles de voz que definen combinaciones de voces para diferentes idiomas.

Fuente: opennet.ru

Compra un hosting fiable para sitios web con protección contra DDoS, servidores VPS VDS 🔥 Compra un hosting fiable para sitios web con protección contra DDoS, servidores VPS VDS | ProHoster