Aggiornamento dei dati vocali Mozilla Common Voice 20

L'azienda Mozilla ha aggiornato i set di dati vocali di Common Voice, includendo esempi di pronuncia di oltre 200 mila persone. I dati sono pubblicati come patrimonio comune (CC0). I set proposti possono essere utilizzati nei sistemi di apprendimento automatico per costruire modelli di riconoscimento e sintesi vocale. Rispetto all'ultimo aggiornamento, il volume del materiale vocale nella collezione è aumentato da 32,6 a 33,1 mila ore di parlato, delle quali 22,1 mila ore hanno superato il controllo. Il numero di lingue supportate è aumentato da 129 a 133 — sono state aggiunte le lingue aragonese, isindebele, sotho meridionale e tupuri.

Nella preparazione dei materiali in lingua inglese hanno partecipato 94,9 mila persone, che hanno dettato 3631 ore di parlato (prima erano 93,9 mila partecipanti e 3587 ore). Il set per la lingua bielorussa comprende 8521 partecipanti e 1860 ore di materiale vocale (prima erano 8444 partecipanti e 1846 ore), per la lingua russa — 3365 partecipanti e 281 ore (prima 3296 partecipanti e 278 ore), per l'uzbeko — 2211 partecipanti e 265 ore (prima 2200 partecipanti e 265 ore), per l'ucraino — 1120 partecipanti e 114 ore (prima 1104 partecipanti e 114 ore).

Il progetto Common Voice organizza il lavoro collaborativo per accumulare una banca di modelli vocali, che tenga conto di tutta la varietà di voci e modi di parlare. Agli utenti viene proposto di pronunciare le frasi visualizzate sullo schermo o valutare la qualità dei dati aggiunti da altri utenti. La banca dati accumulata con registrazioni di diverse pronunce di frasi tipiche del parlato umano può essere utilizzata senza limitazioni nei sistemi di apprendimento automatico e nei progetti di ricerca.

Fonte: opennet.ru

Acquista hosting affidabile per siti web con protezione DDoS, VPS VDS server 🔥 Acquista hosting affidabile per siti web con protezione DDoS, VPS VDS server | ProHoster