Actualización de datos de voz de Mozilla Common Voice 8.0

La empresa Mozilla ha presentado una actualización de los conjuntos de datos de voz Common Voice, que incluyen ejemplos de pronunciación de aproximadamente 200,000 personas. Los datos se publican como dominio público (CC0). Los conjuntos propuestos se pueden utilizar en sistemas de aprendizaje automático para desarrollar modelos de reconocimiento y síntesis de voz. En comparación con la actualización anterior, el volumen de material de voz en la colección ha aumentado en un 30%: de 13.9 a 18.2 mil horas de voz. El número de idiomas soportados ha aumentado de 67 a 87.

El conjunto para el idioma ruso abarca 2452 participantes y 193 horas de material de voz (anteriormente 2136 participantes y 173 horas); para el idioma bielorruso — 6160 participantes y 987 horas (anteriormente 3831 participantes y 356 horas); para el idioma ucraniano — 684 participantes y 76 horas (anteriormente 615 participantes y 66 horas). En la preparación de materiales en inglés participaron más de 79,000 personas, que dictaron 2886 horas de voz confirmada (anteriormente 75,000 participantes y 2637 horas).

Recordemos que el proyecto Common Voice tiene como objetivo organizar el trabajo colaborativo para acumular una base de patrones de voz que refleje toda la diversidad de voces y estilos de habla. Se invita a los usuarios a pronunciar las frases mostradas en pantalla o a evaluar la calidad de los datos añadidos por otros usuarios. La base de datos acumulada con grabaciones de diversas pronunciaciones de frases típicas del habla humana puede ser utilizada sin restricciones en sistemas de aprendizaje automático y en proyectos de investigación. Según el autor de la biblioteca de reconocimiento de voz continua Vosk, las deficiencias del conjunto Common Voice son la unidimensionalidad del material de voz (predominancia de hombres de 20 a 30 años y falta de material con voces de mujeres, niños y ancianos), la ausencia de variabilidad en el vocabulario (repetición de las mismas frases) y la propagación de grabaciones en un formato MP3 que introduce distorsiones.

Además, se puede destacar el lanzamiento de la herramienta NVIDIA NeMo 1.6, que proporciona métodos de aprendizaje automático para crear sistemas de reconocimiento de voz, síntesis de voz y procesamiento de información en lenguaje natural. NeMo incluye modelos preentrenados para sistemas de aprendizaje automático basados en el marco PyTorch, preparados por NVIDIA utilizando datos de voz de Common Voice y abarcando varios idiomas, acentos y formas de habla. Los modelos pueden ser útiles para investigadores que desarrollan sistemas de diálogo por voz, plataformas de transcripción y centros de llamada automatizados. Por ejemplo, NVIDIA NeMo se utiliza en servicios de voz automatizados de MTS y Sberbank. El código de NeMo está escrito en Python utilizando PyTorch y se distribuye bajo la licencia Apache 2.0.

Fuente: opennet.ru

Compra un hosting fiable para sitios web con protección contra DDoS, servidores VPS VDS 🔥 Compra un hosting fiable para sitios web con protección contra DDoS, servidores VPS VDS | ProHoster