La empresa Mozilla ha presentado una actualización de los conjuntos de datos de voz Common Voice, que incluyen ejemplos de pronunciación de alrededor de 200,000 personas. Los datos se publican como dominio público (CC0). Los conjuntos propuestos se pueden utilizar en sistemas de aprendizaje automático para construir modelos de reconocimiento y síntesis de voz.
En comparación con la actualización anterior, el volumen de material de voz en la colección ha aumentado un 10% — de 18.2 a 20.2 mil horas de habla. El número de idiomas soportados ha crecido de 87 a 93. Para 27 idiomas se han acumulado más de 100 horas de datos de voz, y para 9, más de 500 horas de datos de voz. Para 9 idiomas también se ha logrado que la proporción de voz femenina sea de al menos el 45%.
Más de 81,000 personas participaron en la preparación de materiales en inglés, dictando 2,953 horas de habla (había 79,000 participantes y 2,886 horas). El conjunto para el idioma bielorruso abarca 6,326 participantes y 1,054 horas de material hablado (antes había 6,160 participantes y 987 horas), para el idioma ruso — 2,585 participantes y 201 horas (antes había 2,452 participantes y 193 horas), para el uzbeko — 1,503 participantes y 231 horas (antes había 1,355 participantes y 227 horas), para el idioma ucraniano — 696 participantes y 79 horas (antes había 684 participantes y 76 horas).
El proyecto Common Voice tiene como objetivo organizar el trabajo colaborativo para acumular una base de plantillas de voz que considere toda la diversidad de voces y estilos de habla. Se invita a los usuarios a pronunciar las frases mostradas en pantalla o a evaluar la calidad de los datos añadidos por otros usuarios. La base de datos acumulada con las grabaciones de diferentes pronunciaciones de frases típicas del habla humana se puede utilizar sin restricciones en sistemas de aprendizaje automático y en proyectos de investigación.
Fuente: opennet.ru
