Aggiornamento dei dati vocali Mozilla Common Voice 18.0

Mozilla ha aggiornato i set di dati vocali di Common Voice, che includono esempi di pronuncia di oltre 200.000 persone. I dati sono pubblicati come dominio pubblico (CC0). I set proposti possono essere utilizzati nei sistemi di apprendimento automatico per costruire modelli di riconoscimento e sintesi vocale. Rispetto all'aggiornamento precedente, il volume del materiale vocale nella collezione è aumentato da 31.1 a 31.8 mila ore di voce, di cui 20.8 mila ore hanno superato la procedura di verifica. Il numero di lingue supportate è aumentato da 124 a 129 (sono state aggiunte lingue delle tribù africane come il kosa, il kalenjin, il kidavida, il doluo e il tswana).

Nella preparazione dei materiali in lingua inglese hanno partecipato 93.3 mila persone, che hanno registrato 3554 ore di discorsi (erano 92.3 mila partecipanti e 3508 ore). Il set per la lingua bielorussa conta 8400 partecipanti e 1815 ore di materiale vocale (erano 8291 partecipanti e 1766 ore), per la lingua russa — 3241 partecipanti e 277 ore (erano 3206 partecipanti e 274 ore), per l'uzbeco — 2189 partecipanti e 265 ore (erano 2170 partecipanti e 264 ore), e per la lingua ucraina — 1091 partecipanti e 113 ore (erano 1075 partecipanti e 112 ore).

Il progetto Common Voice mira a organizzare una collaborazione per costruire un database di campioni vocali che tenga conto di tutta la varietà di voci e stili di parlato. Gli utenti sono invitati a vocalizzare le frasi visualizzate sullo schermo o a valutare la qualità dei dati aggiunti da altri utenti. Il database accumulato con registrazioni di diverse pronunce di frasi comuni può essere utilizzato senza restrizioni in sistemi di apprendimento automatico e in progetti di ricerca.

Fonte: opennet.ru

Acquista un hosting affidabile per siti web con protezione DDoS, VPS VDS server 🔥 Acquista un hosting affidabile per siti web con protezione DDoS, VPS VDS server | ProHoster