Mozilla a mis à jour les ensembles de données vocales Common Voice, qui comprennent des exemples de prononciation de plus de 200 000 personnes. Les données sont publiées comme domaine public (CC0). Les ensembles proposés peuvent être utilisés dans des systèmes d'apprentissage automatique pour construire des modèles de reconnaissance et de synthèse vocale. Par rapport à la mise à jour précédente, le volume de matériel vocal dans la collection a augmenté de 32,6 à 33,1 mille heures de parole, dont 22,1 mille heures ont été vérifiées. Le nombre de langues prises en charge est passé de 129 à 133 — les langues aragonaises, isindebele, sotho du sud et tupuri ont été ajoutées.
La préparation des matériaux en anglais a impliqué 94,9 mille personnes, qui ont dicté 3631 heures de discours (il y avait 93,9 mille participants et 3587 heures). L'ensemble pour la langue biélorusse couvre 8521 participants et 1860 heures de matériel vocal (il y avait auparavant 8444 participants et 1846 heures), pour la langue russe — 3365 participants et 281 heures (il y avait 3296 participants et 278 heures), pour l'ouzbek — 2211 participants et 265 heures (il y avait 2200 participants et 265 heures), et pour l'ukrainien — 1120 participants et 114 heures (il y avait 1104 participants et 114 heures).
Le projet Common Voice organise une collaboration pour accumuler une base de modèles vocaux, tenant compte de toute la diversité des voix et des styles de discours. Les utilisateurs sont invités à vocaliser les phrases affichées à l'écran ou à évaluer la qualité des données ajoutées par d'autres utilisateurs. La base de données accumulée, contenant des enregistrements de prononciations variées de phrases typiques de la parole humaine sans restrictions, peut être utilisée dans des systèmes d'apprentissage automatique et dans des projets de recherche.
Source : opennet.ru
