La société Mozilla a présenté une mise à jour des ensembles de données vocales Common Voice, comprenant des exemples de prononciation d'environ 200 000 personnes. Les données sont publiées en tant que domaine public (CC0). Les ensembles proposés peuvent être utilisés dans des systèmes d'apprentissage automatique pour construire des modèles de reconnaissance et de synthèse vocale. Par rapport à la mise à jour précédente, le volume de matériel vocal dans la collection a augmenté de 30 % - passant de 13,9 à 18,2 milliers d'heures de discours. Le nombre de langues supportées est passé de 67 à 87.
L'ensemble pour la langue russe couvre 2452 participants et 193 heures de matériel vocal (contre 2136 participants et 173 heures), pour la langue biélorusse - 6160 participants et 987 heures (contre 3831 participants et 356 heures), pour la langue ukrainienne - 684 participants et 76 heures (contre 615 participants et 66 heures). Plus de 79 000 personnes ont participé à la préparation des matériaux en anglais, ayant dicté 2886 heures de discours validé (contre 75 000 participants et 2637 heures).
Rappelons que le projet Common Voice vise à organiser un travail collaboratif pour accumuler une base de modèles vocaux qui prend en compte toute la diversité des voix et des façons de parler. Les utilisateurs sont invités à vocaliser les phrases affichées à l'écran ou à évaluer la qualité des données ajoutées par d'autres utilisateurs. La base de données accumulée avec des enregistrements de différentes prononciations de phrases typiques de la parole humaine peut être utilisée sans restrictions dans des systèmes d'apprentissage automatique et dans des projets de recherche. Selon l'auteur de la bibliothèque de reconnaissance de la parole continue Vosk, les défauts de l'ensemble Common Voice sont l'uniformité du matériel vocal (domination des voix masculines âgées de 20 à 30 ans, et manque de matériel avec des voix de femmes, d'enfants et de personnes âgées), l'absence de variabilité du vocabulaire (répétition des mêmes phrases) et la diffusion des enregistrements dans un format MP3 déformant.
Il convient également de noter la sortie de l'outil NVIDIA NeMo 1.6, qui fournit des méthodes d'apprentissage automatique pour la création de systèmes de reconnaissance vocale, de synthèse vocale et de traitement du langage naturel. NeMo comprend des modèles pré-entraînés pour les systèmes d'apprentissage automatique basés sur le framework PyTorch, préparés par NVIDIA en utilisant les données vocales de Common Voice et couvrant différentes langues, accents et formes de parole. Ces modèles peuvent s'avérer utiles pour les chercheurs travaillant sur la création de systèmes de dialogue vocal, de plateformes de transcription et de centres d'appels automatisés. Par exemple, NVIDIA NeMo est utilisé dans les services vocaux automatisés de MTS et de Sberbank. Le code de NeMo est écrit en Python avec l'utilisation de PyTorch et est distribué sous licence Apache 2.0.
Source : opennet.ru
