Aggiornamento dei dati vocali Mozilla Common Voice 16.0

L'azienda Mozilla ha aggiornato i set di dati vocali Common Voice, che includono esempi di pronuncia di oltre 200.000 persone. I dati sono stati pubblicati come pubblico dominio (CC0). I set proposti possono essere utilizzati nei sistemi di apprendimento automatico per costruire modelli di riconoscimento e sintesi vocale. Rispetto al precedente aggiornamento, il volume del materiale vocale nella collezione è aumentato da 28,7 a 30,3 mila ore di voce, di cui 19,7 mila ore hanno superato la procedura di verifica. Il numero di lingue supportate è aumentato da 114 a 120 (sono stati aggiunti yiddish, lettone, ligure, osseto, telugu e nauatlh occidentale di Sierra Puebla).

Nella preparazione dei materiali in lingua inglese hanno partecipato 90.67 mila persone, che hanno registrato 3438 ore di discorsi (rispetto alle 88.9 mila partecipanti e 3347 ore). Il set per la lingua bielorussa include 8249 partecipanti e 1641 ore di materiale parlato (rispetto a 8205 partecipanti e 1632 ore), per la lingua russa 3133 partecipanti e 265 ore (rispetto ai 3053 partecipanti e 260 ore), per l'uzbeko 2151 partecipanti e 264 ore (rispetto ai 2141 partecipanti e 263 ore), e per l'ucraino 1058 partecipanti e 108 ore (rispetto ai 1024 partecipanti e 105 ore).

Il progetto Common Voice mira a organizzare una collaborazione per costruire un database di campioni vocali che tenga conto di tutta la varietà di voci e stili di parlato. Gli utenti sono invitati a vocalizzare le frasi visualizzate sullo schermo o a valutare la qualità dei dati aggiunti da altri utenti. Il database accumulato con registrazioni di diverse pronunce di frasi comuni può essere utilizzato senza restrizioni in sistemi di apprendimento automatico e in progetti di ricerca.

Fonte: opennet.ru

Acquista un hosting affidabile per siti web con protezione DDoS, VPS VDS server 🔥 Acquista un hosting affidabile per siti web con protezione DDoS, VPS VDS server | ProHoster