Actualización de datos de voz de Mozilla Common Voice 7.0

Las compañías NVIDIA y Mozilla han presentado una actualización de los conjuntos de datos de voz, recopilados como parte de la iniciativa Common Voice, que incluye ejemplos de pronunciación de 182,000 personas, lo que representa un aumento del 25% en comparación con hace 6 meses. Los datos se publican como dominio público (CC0). Los conjuntos propuestos pueden ser utilizados en sistemas de aprendizaje automático para construir modelos de reconocimiento y síntesis de voz.

En comparación con la actualización anterior, el tamaño del material de voz en la colección ha aumentado de 9 a 13.9 mil horas de voz. El número de idiomas soportados ha crecido de 60 a 76, incluyendo por primera vez el apoyo para los idiomas bielorruso, kazajo, uzbeko, búlgaro, armenio, azerbaiyano y bashkir. El conjunto para el idioma ruso abarca 2136 participantes y 173 horas de material de voz (antes había 1412 participantes y 111 horas), mientras que para el idioma ucraniano hay 615 participantes y 66 horas (antes había 459 participantes y 30 horas).

Más de 75,000 personas participaron en la preparación de materiales en inglés, dictando 2637 horas de habla confirmada (antes había 66,000 participantes y 1686 horas). Curiosamente, el segundo idioma en tamaño de datos acumulados es el kinyarwanda, con 2260 horas recopiladas. Le siguen el alemán (1040), el catalán (920) y el esperanto (840). Entre los idiomas que han mostrado el crecimiento más dinámico en el tamaño de datos de voz se encuentran el tailandés (aumento de 20 veces, de 12 a 250 horas), el luganda (de 8 a 80 horas), el esperanto (de 100 a 840 horas) y el tamil (de 24 a 220 horas).

Como parte de su participación en el proyecto Common Voice, la empresa NVIDIA ha preparado modelos entrenados basados en los datos recopilados para sistemas de aprendizaje automático (compatible con PyTorch). Los modelos se distribuyen como parte de la herramienta gratuita y de código abierto NVIDIA NeMo, que ya se utiliza, por ejemplo, en los servicios de voz automatizados de MTS y Sberbank. Los modelos están orientados a su uso en sistemas de reconocimiento de voz, síntesis de voz y procesamiento de información en lenguaje natural, y pueden ser útiles para investigadores que crean sistemas de diálogo por voz, plataformas de transcripción y centros de llamadas automatizados. A diferencia de proyectos anteriores, los modelos publicados no se limitan al reconocimiento del inglés y abarcan diversos idiomas, acentos y formas de habla.

Recordemos que el proyecto Common Voice tiene como objetivo organizar el trabajo conjunto para acumular una base de patrones de voz que tenga en cuenta la diversidad de voces y formas de habla. A los usuarios se les solicita que pronuncien las frases que aparecen en pantalla o que evalúen la calidad de los datos añadidos por otros usuarios. La base de datos acumulada con grabaciones de las diversas pronunciaciones de frases típicas del habla humana se puede usar sin restricciones en sistemas de aprendizaje automático y proyectos de investigación.

Según el autor de la biblioteca de reconocimiento de voz continua Vosk, las desventajas del conjunto Common Voice son la unilateralidad del material de voz (predominancia de hombres de 20 a 30 años y falta de material con voces de mujeres, niños y ancianos), la falta de variabilidad en el vocabulario (repetición de las mismas frases) y la difusión de grabaciones en un formato MP3 que introduce distorsiones.

Fuente: opennet.ru

Compra un hosting fiable para sitios web con protección contra DDoS, servidores VPS VDS 🔥 Compra un hosting fiable para sitios web con protección contra DDoS, servidores VPS VDS | ProHoster