En la primera parte hablé brevemente sobre la propia construcción que permite hacer una computadora que pueda ejecutar unRAID.

Presentado lanzamiento del motor de reconocimiento de voz desarrollado por Mozilla DeepSpeech 0.6, que implementa la arquitectura de reconocimiento de voz del mismo nombre, propuesta por investigadores de Baidu. La implementación está escrita en Python utilizando la plataforma de aprendizaje automático TensorFlow y se distribuye está bajo la licencia abierta MPL 2.0. Se admite su funcionamiento en Linux, Android, macOS y Windows. La potencia es suficiente para usar el motor en placas LePotato, Raspberry Pi 3 y Raspberry Pi 4.

El paquete también incluye disponibles modelos entrenados, ejemplos archivos de audio y herramientas para el reconocimiento desde la línea de comandos. Para integrar la función de reconocimiento de voz en sus programas, se ofrecen módulos listos para usar para Python, NodeJS, C++ y .NET (desarrolladores externos han preparado módulos para Rust y Go). El modelo listo se ofrece solo para el idioma inglés, pero para otros idiomas se puede entrenar el sistema por la guía la documentación adjunta, utilizando datos de voz, recopilados por el proyecto Common Voice.

DeepSpeech es significativamente más sencillo que los sistemas tradicionales y, al mismo tiempo, proporciona una mayor calidad de reconocimiento en presencia de ruido externo. No se utilizan modelos acústicos tradicionales ni la concepción de fonemas; en su lugar, se aplica un sistema de aprendizaje automático bien optimizado basado en redes neuronales, lo que permite prescindir del desarrollo de componentes separados para modelar diferentes desviaciones, como ruido, eco y peculiaridades del habla.

La desventaja de este enfoque es que, para obtener un reconocimiento de calidad y entrenar la red neuronal, el motor DeepSpeech requiere un gran volumen de datos heterogéneos, dictados en condiciones reales por diferentes voces y en presencia de ruidos naturales.
La recopilación de tales datos es realizada por el proyecto creado en Mozilla Common Voice, que proporciona un conjunto de datos verificado con 780 horas en inglés, 325 en alemán, 173 en francés y 27 horas en ruso.

El objetivo final del proyecto Common Voice es acumular 10,000 horas de grabaciones con diferentes pronunciaciones de frases típicas del habla humana, lo que permitirá alcanzar un nivel aceptable de errores en el reconocimiento. En su estado actual, los participantes del proyecto ya han dictado un total de 4,3 mil horas, de las cuales 3,5 mil han sido verificadas. Para entrenar el modelo final del idioma inglés para DeepSpeech se utilizaron 3,816 horas de habla, además de Common Voice, que abarca datos de los proyectos LibriSpeech, Fisher y Switchboard, así como alrededor de 1,700 horas de grabaciones transcritas de programas de radio.

Al utilizar el modelo preentrenado de idioma inglés, la tasa de errores de reconocimiento en DeepSpeech es del 7,5% según la evaluación del conjunto de prueba. LibriSpeech. En comparación, la tasa de errores al ser reconocido por un ser humano se evalúa en 5,83%.

DeepSpeech consta de dos subsistemas: un modelo acústico y un decodificador. El modelo acústico utiliza métodos de aprendizaje automático profundo para calcular la probabilidad de la presencia de ciertos símbolos en el sonido ingresado. El decodificador aplica un algoritmo de búsqueda en haz para convertir los datos de probabilidad de los símbolos en una representación textual.

Principales novedades DeepSpeech 0.6 (la rama 0.6 no es compatible con versiones anteriores y requiere actualización del código y los modelos):

  • Se ha propuesto un nuevo decodificador en streaming que proporciona una mayor capacidad de respuesta y no depende del tamaño de los datos de audio procesados. Como resultado, en la nueva versión de DeepSpeech se ha logrado reducir la latencia del reconocimiento a 260 ms, lo que es un 73% más rápido que antes, y permite aplicar DeepSpeech en soluciones de reconocimiento de voz en tiempo real.
  • Se han realizado cambios en la API y se ha trabajado en la unificación de los nombres de las funciones. Se han añadido funciones para obtener metadatos adicionales sobre la sincronización, permitiendo no solo obtener una representación textual en la salida, sino también rastrear la vinculación de símbolos y oraciones individuales a la posición en el flujo de audio.
  • Se ha añadido soporte para el uso de la biblioteca CuDNN para optimizar el trabajo con redes neuronales recurrentes (RNN), lo que permitió lograr un aumento notable (casi el doble) en el rendimiento del entrenamiento del modelo, aunque requirió cambios en el código que afectan la compatibilidad con modelos previamente preparados.
  • Los requisitos mínimos para la versión de TensorFlow se han incrementado de 1.13.1 a 1.14.0. Se ha añadido soporte para la versión ligera TensorFlow Lite, lo que ha reducido el tamaño del paquete DeepSpeech de 98 MB a 3.7 MB. Para su uso en dispositivos integrados y móviles, el tamaño del archivo empaquetado con el modelo también se ha reducido de 188 MB a 47 MB (se utilizó un método de cuantización después de finalizar el entrenamiento del modelo).
  • El modelo de lenguaje se ha convertido a otro formato de estructuras de datos que permite mapear archivos en memoria al cargarlos. El soporte para el antiguo formato ha sido descontinuado.
  • Se ha modificado el modo de carga del archivo con el modelo de lenguaje, lo que ha permitido reducir el consumo de memoria y disminuir la latencia al procesar la primera solicitud después de crear el modelo. Ahora, DeepSpeech consume 22 veces menos memoria y se inicia 500 veces más rápido.

    En la primera parte hablé brevemente sobre la propia construcción que permite hacer una computadora que pueda ejecutar unRAID.
  • Se ha realizado una filtración de palabras raras en el modelo de lenguaje. El total de palabras se ha reducido a las 500 mil más populares que aparecen en el texto utilizado para entrenar el modelo. La limpieza realizada ha permitido reducir el tamaño del modelo de lenguaje de 1800 MB a 900 MB, casi sin afectar los niveles de error de reconocimiento.
  • Se ha añadido soporte para diversas técnicas de creación de variaciones adicionales (augmentation) de los datos de audio utilizados durante el entrenamiento (por ejemplo, añadiendo al conjunto variaciones que contienen distorsiones o ruidos).
  • Se ha añadido una biblioteca con enlaces para integración con aplicaciones basadas en la plataforma .NET.
  • Se ha revisado la documentación, que ahora se ha recopilado en un sitio web separado deepspeech.readthedocs.io.

Fuente: opennet.ru

Compra un hosting fiable para sitios web con protección contra DDoS, servidores VPS VDS 🔥 Compra un hosting fiable para sitios web con protección contra DDoS, servidores VPS VDS | ProHoster