Mise à jour des données vocales Mozilla Common Voice 7.0

Les entreprises NVIDIA et Mozilla ont présenté une mise à jour des ensembles de données vocales, réunies dans le cadre de l'initiative Common Voice et comprenant des exemples de prononciation de 182 000 personnes, soit 25 % de plus qu'il y a 6 mois. Les données ont été publiées comme domaine public (CC0). Les ensembles proposés peuvent être utilisés dans des systèmes d'apprentissage automatique pour construire des modèles de reconnaissance et de synthèse vocale.

Comparé à la précédente mise à jour, la taille du matériel vocal dans la collection a augmenté de 9 à 13,9 mille heures de discours. Le nombre de langues prises en charge est passé de 60 à 76, avec l'ajout pour la première fois du biélorusse, du kazakh, de l'ouzbek, du bulgare, de l'arménien, de l'azéri et du bachkir. L'ensemble pour la langue russe couvre 2136 participants et 173 heures de matériel vocal (contre 1412 participants et 111 heures), tandis que pour la langue ukrainienne, ce sont 615 participants et 66 heures (contre 459 participants et 30 heures).

Plus de 75 000 personnes ont participé à la préparation de matériaux en anglais, enregistrant 2637 heures de discours vérifié (contre 66 000 participants et 1686 heures). Fait intéressant, la langue rwandaise arrive en deuxième position en termes de taille des données accumulées, avec 2260 heures. Viennent ensuite l'allemand (1040), le catalan (920) et l'espéranto (840). Parmi les langues avec une augmentation dynamique de la taille des données vocales, on note le thaï (croissance de 20 fois, passant de 12 à 250 heures), le luganda (de 8 à 80 heures), l'espéranto (de 100 à 840 heures) et le tamoul (de 24 à 220 heures).

Dans le cadre de sa participation au projet Common Voice, la société NVIDIA a préparé des modèles d'apprentissage automatique pré-entraînés basés sur des données collectées (compatibles avec PyTorch). Les modèles sont distribués dans le cadre de l'outil gratuit et ouvert NVIDIA NeMo, qui est déjà utilisé dans des services vocaux automatisés tels que MTS et Sberbank. Ces modèles sont destinés à être utilisés dans des systèmes de reconnaissance vocale, de synthèse vocale et de traitement d'informations en langage naturel, et peuvent être utiles aux chercheurs développant des systèmes de dialogue vocal, des plateformes de transcription et des centres d'appels automatisés. Contrairement aux projets précédemment disponibles, les modèles publiés ne se limitent pas à la reconnaissance de l'anglais et couvrent plusieurs langues, accents et formes de parole.

Rappelons que le projet Common Voice vise à organiser un travail collaboratif pour accumuler une base de modèles vocaux tenant compte de toute la diversité des voix et des manières de parler. Les utilisateurs sont invités à vocaliser les phrases affichées à l'écran ou à évaluer la qualité des données ajoutées par d'autres utilisateurs. La base de données accumulée, comprenant des enregistrements de différentes prononciations de phrases typiques de la parole humaine, peut être utilisée sans restrictions dans des systèmes d'apprentissage automatique et dans des projets de recherche.

Selon l'auteur de la bibliothèque de reconnaissance vocale continue Vosk, les défauts du dataset Common Voice sont le manque de diversité des matériaux vocaux (predominance des hommes âgés de 20 à 30 ans et manque de matériel avec des voix de femmes, d'enfants et de personnes âgées), l'absence de variabilité dans le vocabulaire (répétition des mêmes phrases) et la diffusion d'enregistrements en format MP3 qui introduisent des distorsions.

Source : opennet.ru

Acheter un hébergement fiable pour les sites avec protection DDoS, serveurs VPS VDS 🔥 Acheter un hébergement fiable pour les sites avec protection DDoS, serveurs VPS VDS | ProHoster