La compañía Mozilla ha actualizado los conjuntos de datos de voz Common Voice, incluyendo ejemplos de pronunciación de más de 200 mil personas. Los datos se publican como dominio público (CC0). Los conjuntos propuestos pueden ser utilizados en sistemas de aprendizaje automático para construir modelos de reconocimiento y síntesis de voz. En comparación con la última actualización, el volumen de material de voz en la colección ha aumentado de 31.1 a 31.8 mil horas de voz, de las cuales 20.8 mil horas han pasado el proceso de verificación. El número de idiomas soportados ha aumentado de 124 a 129 (se han añadido los idiomas de las tribus africanas kosa, kalenjin, kidiavid, dholuo y tswana).
En la preparación de materiales en inglés participaron 93.3 mil personas, que dictaron 3554 horas de voz (había 92.3 mil participantes y 3508 horas). El conjunto para el idioma bielorruso abarca 8400 participantes y 1815 horas de material de voz (había 8291 participantes y 1766 horas), para el idioma ruso – 3241 participantes y 277 horas (había 3206 participantes y 274 horas), para el uzbeko – 2189 participantes y 265 horas (había 2170 participantes y 264 horas), y para el idioma ucraniano – 1091 participante y 113 horas (había 1075 participantes y 112 horas).
El proyecto Common Voice tiene como objetivo organizar el trabajo colaborativo para acumular una base de plantillas de voz que considere toda la diversidad de voces y estilos de habla. Se invita a los usuarios a pronunciar las frases mostradas en pantalla o a evaluar la calidad de los datos añadidos por otros usuarios. La base de datos acumulada con las grabaciones de diferentes pronunciaciones de frases típicas del habla humana se puede utilizar sin restricciones en sistemas de aprendizaje automático y en proyectos de investigación.
Fuente: opennet.ru
