Lanzamiento del sintetizador de voz RHVoice 1.6.0

Se ha lanzado la versión 1.6.0 del sistema abierto de síntesis de voz RHVoice, inicialmente desarrollado para proporcionar un soporte de calidad para el idioma ruso, pero luego adaptado también a otros idiomas, incluyendo inglés, portugués, ucraniano, kirguís, tártaro y georgiano. El código está escrito en C++ y se distribuye bajo la licencia LGPL 2.1. Es compatible con GNU/Linux, Windows y Android. El programa es compatible con las interfaces TTS estándar (text-to-speech) para convertir texto en voz: SAPI5 (Windows), Speech Dispatcher (GNU/Linux) y Android Text-To-Speech API, pero también puede utilizarse en el lector de pantalla NVDA. La creadora y principal desarrolladora de RHVoice es Olga Yakovleva, quien sigue desarrollando el proyecto a pesar de su ceguera total.

La nueva versión añade 5 nuevas variaciones de voces para el habla rusa. Se ha implementado soporte para el idioma albanés. Se ha actualizado el diccionario para el idioma ucraniano. Se ha ampliado el soporte para la vocalización de caracteres emoji. Se han corregido errores en la aplicación para la plataforma Android, se ha simplificado la importación de diccionarios personalizados y se ha añadido soporte para Android 11. Se han incorporado nuevas configuraciones y funcionalidades en el núcleo del motor, incluyendo g2p.case, word_break y soporte para filtros de ecualización.

Cabe recordar que en RHVoice se utilizan los desarrollos del proyecto HTS (HMM/DNN-based Speech Synthesis System) y el método paramétrico de síntesis con modelos estadísticos (Statistical Parametric Synthesis basado en HMM - Hidden Markov Model). La ventaja del modelo estadístico es el bajo consumo de recursos y la no exigencia de potencia de CPU. Todas las operaciones se realizan de forma local en el sistema del usuario. Se soportan tres niveles de calidad de voz (cuanto menor es la calidad, mayor es el rendimiento y menor es el tiempo de respuesta).

Una desventaja del modelo estadístico es la calidad de pronunciación relativamente baja, que no alcanza el nivel de los sintetizadores que generan voz en base a la combinación de fragmentos de voz natural, pero aun así el resultado es bastante comprensible y recuerda a la transmisión de una grabación a través de un altavoz. En comparación, el proyecto Silero, que proporciona un motor de síntesis de voz abierto basado en tecnologías de aprendizaje automático y un conjunto de modelos para el idioma ruso, supera en calidad a RHVoice.

Para el idioma ruso están disponibles 13 variaciones de voces, y para el inglés, 5. Las voces se generan a partir de grabaciones de voz natural. En la configuración se puede cambiar la velocidad, el tono y el volumen. Se puede aplicar la biblioteca Sonic para modificar el ritmo. Es posible la detección y el cambio automático de idioma basado en el análisis del texto de entrada (por ejemplo, para palabras y citas en otro idioma se puede usar el modelo de síntesis nativo de ese idioma). Se soportan perfiles de voz que definen combinaciones de voces para diferentes idiomas.

Fuente: opennet.ru

Compra un hosting fiable para sitios web con protección contra DDoS, servidores VPS VDS 🔥 Compra un hosting fiable para sitios web con protección contra DDoS, servidores VPS VDS | ProHoster