La société Mozilla a mis à jour les ensembles de données vocales Common Voice, incluant des exemples de prononciation de plus de 200 000 personnes. Les données sont publiées dans le domaine public (CC0). Les ensembles proposés peuvent être utilisés dans des systèmes d'apprentissage automatique pour la création de modèles de reconnaissance et de synthèse vocale. Par rapport à la dernière mise à jour, le volume de matériel vocal dans la collection a augmenté de 31,1 à 31,8 milliers d'heures de discours, dont 20,8 milliers d'heures ont été vérifiées. Le nombre de langues prises en charge est passé de 124 à 129 (les langues des tribus africaines kosa, kalenjin, kidawida, dolo et tswana ont été ajoutées).
93 300 personnes ont participé à la préparation des matériaux en anglais, ayant dicté 3 554 heures de discours (il y avait 92 300 participants et 3 508 heures). L'ensemble pour la langue biélorusse couvre 8 400 participants et 1 815 heures de matériel vocal (il y avait 8 291 participants et 1 766 heures), pour la langue russe — 3 241 participants et 277 heures (il y avait 3 206 participants et 274 heures), pour le ouzbek — 2 189 participants et 265 heures (il y avait 2 170 participants et 264 heures), et pour l'ukrainien — 1 091 participants et 113 heures (il y avait 1 075 participants et 112 heures).
Le projet Common Voice vise à organiser un travail collaboratif pour accumuler une base de modèles vocaux, tenant compte de toute la diversité des voix et des manières de parler. Les utilisateurs sont invités à prononcer les phrases affichées à l'écran ou à évaluer la qualité des données ajoutées par d'autres utilisateurs. La base de données accumulée avec des enregistrements de différentes prononciations de phrases standard de la parole humaine peut être utilisée sans restriction dans des systèmes d'apprentissage automatique et dans des projets de recherche.
Source : opennet.ru
