L'azienda Mozilla ha presentato un aggiornamento dei set di dati vocali Common Voice, che includono esempi di pronuncia di circa 200.000 persone. I dati sono stati pubblicati come dominio pubblico (CC0). I set proposti possono essere utilizzati nei sistemi di apprendimento automatico per creare modelli di riconoscimento e sintesi vocale. Rispetto all'aggiornamento precedente, il volume del materiale vocale nella collezione è aumentato del 30% - da 13,9 a 18,2 mila ore di voce. Il numero di lingue supportate è aumentato da 67 a 87.
Il set per la lingua russa comprende 2452 partecipanti e 193 ore di materiale vocale (erano 2136 partecipanti e 173 ore), per la lingua bielorussa - 6160 partecipanti e 987 ore (erano 3831 partecipanti e 356 ore), per la lingua ucraina - 684 partecipanti e 76 ore (erano 615 partecipanti e 66 ore). Nella preparazione dei materiali in lingua inglese hanno partecipato più di 79.000 persone, che hanno registrato 2886 ore di voce confermata (erano 75.000 partecipanti e 2637 ore).
Ricordiamo che il progetto Common Voice mira a organizzare una collaborazione per accumulare una base di modelli vocali che rappresenti la varietà di voci e modi di parlare. Agli utenti viene proposto di pronunciare le frasi visualizzate sullo schermo o di valutare la qualità dei dati aggiunti da altri utenti. La base di dati accumulata con registrazioni di varia pronuncia di frasi comuni può essere utilizzata senza restrizioni nei sistemi di apprendimento automatico e nei progetti di ricerca. Secondo l'autore della libreria di riconoscimento vocale continuo Vosk, i difetti del set Common Voice sono la parzialità del materiale vocale (sovrabbondanza di uomini di età compresa tra i 20 e i 30 anni e mancanza di materiale con la voce di donne, bambini e anziani), l'assenza di variabilità nel vocabolario (ripetizione delle stesse frasi) e la diffusione di registrazioni in un formato MP3 che introduce distorsioni.
Inoltre, si può notare il rilascio dello strumento NVIDIA NeMo 1.6, che offre metodi di apprendimento automatico per la creazione di sistemi di riconoscimento vocale, sintesi vocale e elaborazione del linguaggio naturale. NeMo include modelli pre-addestrati per sistemi di apprendimento automatico basati sul framework PyTorch, preparati da NVIDIA utilizzando dati vocali di Common Voice e che coprono diverse lingue, accenti e modi di parlare. Questi modelli possono essere utili per i ricercatori che lavorano alla creazione di sistemi di dialogo vocale, piattaforme per la trascrizione e call center automatizzati. Ad esempio, NVIDIA NeMo viene utilizzato nei servizi vocali automatizzati di MTS e Sberbank. Il codice NeMo è scritto in Python utilizzando PyTorch ed è distribuito sotto la licenza Apache 2.0.
Fonte: opennet.ru
