La empresa Mozilla ha actualizado los conjuntos de datos de voz Common Voice, que incluyen ejemplos de pronunciación de más de 200,000 personas. Los datos se publican como dominio público (CC0). Los conjuntos propuestos se pueden utilizar en sistemas de aprendizaje automático para la construcción de modelos de reconocimiento y síntesis de voz. En comparación con la última actualización, el volumen de material de voz en la colección ha aumentado de 32.6 a 33.1 mil horas de habla, de las cuales 22.1 mil horas han sido verificadas. El número de idiomas soportados ha aumentado de 129 a 133, con la adición de los idiomas aragonés, sisindebele, sotho del sur y tupuri.
En la preparación de materiales en inglés participaron 94.9 mil personas, que dictaron 3631 horas de habla (había 93.9 mil participantes y 3587 horas). El conjunto para el idioma bielorruso abarca 8521 participantes y 1860 horas de material de habla (había 8444 participantes y 1846 horas), el idioma ruso — 3365 participantes y 281 horas (había 3296 participantes y 278 horas), el uzbeko — 2211 participantes y 265 horas (había 2200 participantes y 265 horas), el idioma ucraniano — 1120 participantes y 114 horas (había 1104 participantes y 114 horas).
El proyecto Common Voice organiza el trabajo conjunto para acumular una base de plantillas de voz que refleje toda la diversidad de voces y estilos de habla. Se invita a los usuarios a pronunciar frases que aparecen en pantalla o a evaluar la calidad de los datos añadidos por otros usuarios. La base de datos acumulada con grabaciones de diversas pronunciaciones de frases típicas del habla humana puede utilizarse sin restricciones en sistemas de aprendizaje automático y en proyectos de investigación.
Fuente: opennet.ru
