La empresa Mozilla ha actualizado los conjuntos de datos de voz Common Voice, que incluyen ejemplos de pronunciación de más de 200,000 personas. Los datos se publican como dominio público (CC0). Los conjuntos propuestos se pueden utilizar en sistemas de aprendizaje automático para construir modelos de reconocimiento y síntesis de voz.
En comparación con la actualización anterior, la cantidad de material de voz en la colección ha aumentado de 23.8 a 25.8 mil horas de habla. En la preparación de materiales en inglés, participaron más de 88,000 personas, que dictaron 3,161 horas de habla (había 84,000 participantes y 3,098 horas). El conjunto para el idioma bielorruso abarca 7,903 participantes y 1,419 horas de material de voz (había 6,965 participantes y 1,217 horas), para el ruso — 2,815 participantes y 229 horas (había 2,731 participantes y 215 horas), para el uzbeko — 2,092 participantes y 262 horas (había 2,025 participantes y 258 horas), y para el ucraniano — 780 participantes y 87 horas (había 759 participantes y 87 horas).
El proyecto Common Voice tiene como objetivo organizar el trabajo colaborativo para acumular una base de plantillas de voz que considere toda la diversidad de voces y estilos de habla. Se invita a los usuarios a pronunciar las frases mostradas en pantalla o a evaluar la calidad de los datos añadidos por otros usuarios. La base de datos acumulada con las grabaciones de diferentes pronunciaciones de frases típicas del habla humana se puede utilizar sin restricciones en sistemas de aprendizaje automático y en proyectos de investigación.
Fuente: opennet.ru
