La empresa Mozilla ha actualizado los conjuntos de datos de voz Common Voice, que incluyen ejemplos de pronunciación de más de 200,000 personas. Los datos se publican como dominio público (CC0). Los conjuntos propuestos se pueden utilizar en sistemas de aprendizaje automático para construir modelos de reconocimiento y síntesis de voz. En comparación con la actualización anterior, el volumen de material de voz en la colección ha aumentado de 28.7 a 30.3 mil horas de discurso, de las cuales 19.7 mil horas han sido verificadas. El número de idiomas soportados ha aumentado de 114 a 120 (se han añadido yidis, letón, ligur, ossetio, telugu y náhuatl occidental de Sierra Puebla).
En la preparación de materiales en inglés participaron 90,670 personas, que dictaron 3,438 horas de discurso (antes había 88,900 participantes y 3,347 horas). El conjunto para el idioma bielorruso abarca 8,249 participantes y 1,641 horas de material de voz (antes había 8,205 participantes y 1,632 horas), el ruso — 3,133 participantes y 265 horas (antes había 3,053 participantes y 260 horas), el uzbeko — 2,151 participantes y 264 horas (antes había 2,141 participantes y 263 horas), el ucraniano — 1,058 participantes y 108 horas (antes había 1,024 participantes y 105 horas).
El proyecto Common Voice tiene como objetivo organizar el trabajo colaborativo para acumular una base de plantillas de voz que considere toda la diversidad de voces y estilos de habla. Se invita a los usuarios a pronunciar las frases mostradas en pantalla o a evaluar la calidad de los datos añadidos por otros usuarios. La base de datos acumulada con las grabaciones de diferentes pronunciaciones de frases típicas del habla humana se puede utilizar sin restricciones en sistemas de aprendizaje automático y en proyectos de investigación.
Fuente: opennet.ru
