El proyecto ChatTTS ha publicado un modelo y las herramientas de aprendizaje automático relacionadas para la síntesis de voz emocional. El proyecto ChatTTS está especialmente optimizado para su uso en sistemas de diálogo, como asistentes interactivos, y se centra en reproducir las propiedades de la comunicación emocional natural. Se admite la interacción con varios hablantes y la construcción de diálogos interactivos. Los elementos prosódicos, como la risa, las pausas y las interjecciones, se rastrean y reproducen correctamente durante la síntesis.
Se utilizó aproximadamente 40,000 horas de grabaciones de voz para entrenar el modelo (en la versión no pública del modelo se usaron 100,000 horas). Según los desarrolladores, el modelo supera todas las modelos de síntesis de voz previamente disponibles en cuanto a su capacidad para generar entonaciones. Actualmente, para controlar las emociones durante la síntesis, solo se admite la sustitución de tokens, por ejemplo, ‘[laugh]’ para la risa. Se requiere una GPU con 4 GB de memoria para generar grabaciones de 30 segundos. En una GPU NVIDIA GeForce RTX 4090D, la velocidad de generación es aproximadamente de 7 tokens semánticos por segundo. Se admite la síntesis en voces femeninas y masculinas en inglés y chino (para el idioma ruso se puede recomendar el marco TTS y el modelo XTTS-v2, que, además de la síntesis, permiten la clonación de voz a partir de una grabación corta de voz, incluso para la síntesis en otro idioma).
El modelo ChatTTS se publica bajo la licencia CC BY-NC-ND 4.0 (Creative Commons Attribution-NonCommercial-NoDerivatives 4.0), que permite la distribución libre con atribución al autor, pero prohíbe la creación de obras derivadas y el uso en proyectos comerciales. Además, para protegerse contra el uso del modelo para cometer actividades fraudulentas y criminales, se utilizó la inserción de ruido de alta frecuencia y se implementó el nivel máximo de compresión de audio utilizando el formato MP3 durante el entrenamiento del modelo.
Fuente: opennet.ru
