Se ha publicado el modelo de IA de síntesis de voz Zonos, que admite la clonación de voz.

La compañía Zyphra ha publicado bajo la licencia Apache 2.0 la primera versión beta del modelo de IA para síntesis de voz Zonos. La herramienta que se ofrece junto con el modelo admite la función de clonación de voz, que permite sintetizar el habla con la voz deseada, para la cual el modelo solo necesita una grabación de referencia de 30 segundos de la voz del hablante. Se admite la síntesis en inglés, japonés, chino, francés y alemán.

El modelo abarca 1.6 mil millones de parámetros y ha sido entrenado con 200 mil horas de grabaciones de audio. Se admite la síntesis de habla monótona (como en audiolibros) y emocional (como en una conversación en vivo), así como la síntesis basada en un prefijo dado (se proporciona una grabación de audio con el inicio del discurso, sobre la cual el modelo sintetiza la continuación según el texto indicado, reproduciendo las características originales de la voz, por ejemplo, continuando hablando en susurros).

La salida genera sonido con una frecuencia de muestreo de 44 kHz. Se admite la sustitución de fragmentos sintetizados para simular presentaciones con varios oradores o construir diálogos interactivos, así como la adición de etiquetas para controlar la velocidad del habla, la tonalidad y la expresión de emociones como la alegría, el miedo, la tristeza y la ira.

Según los desarrolladores, en cuanto a la calidad de la voz generada, el modelo no es inferior ni supera a todos los sistemas de síntesis abiertos y comerciales disponibles públicamente (en las pruebas se compara con ElevenLabs, Cartesia y FishSpeech). Entre las desventajas se señala una mayor concentración de artefactos sonoros, como tos, ruido de respiración o chirridos, al principio o al final del material sonoro generado.

  • Zonos:
  • ElevenLabs:
  • Cartesia:
  • Fish Speech v1.5:

Para utilizar el modelo en su sistema, se ha preparado una imagen lista para usar para el sistema Docker, que incluye una interfaz web para gestionar la síntesis, basada en la plataforma Gradio. Para comenzar a trabajar, basta con instalar la imagen con el comando «git clone https://github.com/Zyphra/Zonos.git; cd Zonos; docker compose up» y abrir en el navegador la página «http://localhost:7860». Se recomienda tener una GPU NVIDIA de al menos la serie 3000 con 6 GB de memoria de video. El rendimiento en un sistema con GPU RTX 4090 supera en dos veces las capacidades necesarias para la síntesis en tiempo real.

Se ha publicado el modelo de IA de síntesis de voz Zonos, que admite la clonación de voz.


Fuente: opennet.ru
Compra un hosting fiable para sitios web con protección contra DDoS, servidores VPS VDS 🔥 Compra un hosting fiable para sitios web con protección contra DDoS, servidores VPS VDS | ProHoster