Mozilla ha aggiornato i set di dati vocali Common Voice, che includono esempi di pronuncia di oltre 200.000 persone. I dati sono pubblicati come dominio pubblico (CC0). I set proposti possono essere utilizzati nei sistemi di apprendimento automatico per sviluppare modelli di riconoscimento e sintesi vocale. Rispetto all'aggiornamento precedente, la quantità di materiale vocale nella collezione è aumentata da 31,1 a 31,8 mila ore di discorso, di cui 20,8 mila ore hanno superato la verifica. Il numero di lingue supportate è aumentato da 124 a 129 (sono state aggiunte le lingue delle tribù africane: xhosa, kalenjin, kiadavida, dholuo e tswana).
Nella preparazione dei materiali in lingua inglese hanno partecipato 93.300 persone, che hanno registrato 3.554 ore di discorso (c'erano 92.300 partecipanti e 3.508 ore). Il set per la lingua bielorussa copre 8.400 partecipanti e 1.815 ore di materiale vocale (c'erano 8.291 partecipanti e 1.766 ore), per la lingua russa – 3.241 partecipanti e 277 ore (c'erano 3.206 partecipanti e 274 ore), per la lingua uzbeka – 2.189 partecipanti e 265 ore (c'erano 2.170 partecipanti e 264 ore), per la lingua ucraina – 1.091 partecipanti e 113 ore (c'erano 1.075 partecipanti e 112 ore).
Il progetto Common Voice mira a organizzare una collaborazione per accumulare una base di modelli vocali che tenga conto di tutta la varietà di voci e modi di parlare. Gli utenti sono invitati a vocalizzare le frasi visualizzate sullo schermo o a valutare la qualità dei dati aggiunti da altri utenti. La base di dati accumulata con registrazioni di varie pronunce di frasi tipiche del linguaggio umano può essere utilizzata senza restrizioni in sistemi di apprendimento automatico e in progetti di ricerca.
Fonte: opennet.ru
