Nueva versión del sistema de síntesis de voz Silero

Está disponible una nueva versión pública del sistema de síntesis de voz con inteligencia artificial Silero Text-to-Speech. El proyecto tiene como objetivo principal crear un sistema de síntesis de voz moderno y de alta calidad, que rivalice con las soluciones comerciales de corporaciones y esté disponible para todos los interesados sin necesidad de costoso hardware de servidor.

Los modelos se distribuyen bajo la licencia GNU AGPL, pero la empresa que desarrolla el proyecto no revela el mecanismo de entrenamiento de los modelos. Para su ejecución, se puede utilizar PyTorch y marcos que soporten el formato ONNX. La síntesis de voz en Silero se basa en el uso de algoritmos de red neuronal modernos, profundamente modificados, y métodos de procesamiento digital de señales.

Se destaca que el principal problema de las soluciones actuales de redes neuronales para la síntesis de voz es que a menudo solo están disponibles en el marco de soluciones en la nube de pago, mientras que los productos públicos tienen altos requerimientos de hardware, calidad inferior o no están terminados y listos para su uso. Por ejemplo, para ejecutar sin problemas una de las nuevas arquitecturas populares de síntesis end-to-end, VITS, en modo de síntesis (es decir, no para el entrenamiento de modelos), se requieren tarjetas gráficas con más de 16 gigabytes de VRAM.

A pesar de la tendencia existente, las soluciones Silero se ejecutan con éxito incluso en un solo hilo de procesador Intel x86 con instrucciones AVX2. En 4 hilos de procesador, la síntesis permite sintetizar entre 30 y 60 segundos por segundo en modo de 8 kHz, en modo de 24 kHz — 15-20 seg., y en modo de 48 kHz — alrededor de 10 seg.

Características principales de la nueva versión de Silero:

  • El tamaño del modelo se ha reducido a la mitad, hasta 50 megabytes;
  • Los modelos pueden hacer pausas;
  • Se ofrecen 4 voces de alta calidad en ruso (y un número infinito de aleatorias). Ejemplos de pronunciación;
  • Los modelos se han vuelto 10 veces más rápidos y, por ejemplo, en modo de 24 kHz permiten sintetizar hasta 20 segundos de audio por segundo en 4 hilos de procesador;
  • Todas las variantes de voces para un idioma están empaquetadas en un solo modelo;
  • Los modelos pueden aceptar párrafos completos de texto como entrada, se soportan etiquetas SSML;
  • La síntesis funciona simultáneamente en tres frecuencias de muestreo a elección: 8, 24 y 48 kilohertz;
  • Se han resuelto los 'problemas infantiles': inestabilidad y omisión de palabras;
  • Se han añadido banderas para controlar la colocación automática de acentos y la inclusión de la letra “ё”.

Actualmente, la versión más reciente de la síntesis tiene disponibles 4 voces en ruso, pero en un futuro cercano se publicará la siguiente versión con las siguientes mejoras:

  • La velocidad de la síntesis aumentará entre 2 y 4 veces más;
  • Se actualizarán los modelos de síntesis para los idiomas de la CEI: kalmuko, tártaro, uzbeko y ucraniano;
  • Se agregarán modelos para idiomas europeos;
  • Se agregarán modelos para idiomas indios;
  • Se agregarán modelos para el idioma inglés.

Algunos de los problemas inherentes al sistema de síntesis Silero son:

  • A diferencia de las soluciones de síntesis más tradicionales, como RHVoice, la síntesis Silero no tiene integración con SAPI, ni clientes fáciles de instalar o integraciones para Windows y Android;
  • La velocidad, aunque es inusitadamente alta para este tipo de solución, puede ser insuficiente para la síntesis en tiempo real en procesadores débiles con alta calidad;
  • La solución para la colocación automática de acentos no maneja los homógrafos (palabras como zÁmok y zamOk) y aún comete errores, pero esta inconsistencia se corregirá en futuras versiones;
  • La versión actual de la síntesis no funciona en procesadores sin instrucciones AVX2 (o es necesario modificar especialmente la configuración de PyTorch), ya que uno de los módulos dentro del modelo está cuantizado;
  • La versión actual de la síntesis tiene como única dependencia a PyTorch, toda la infraestructura está 'embebida' dentro del modelo y de los paquetes JIT. No se publican los fuentes de los modelos, ni el código para ejecutar modelos desde clientes de PyTorch para otros idiomas;
  • Libtorch, disponible para plataformas móviles, es considerablemente más voluminosa que el runtime de ONNX, pero la versión ONNX del modelo aún no está disponible.

Fuente: opennet.ru

Compra un hosting fiable para sitios web con protección contra DDoS, servidores VPS VDS 🔥 Compra un hosting fiable para sitios web con protección contra DDoS, servidores VPS VDS | ProHoster