Aggiornamento dei dati vocali Mozilla Common Voice 7.0

Le aziende NVIDIA e Mozilla hanno presentato un aggiornamento dei set di dati vocali raccolti nell'ambito dell'iniziativa Common Voice, includendo esempi di pronuncia di 182.000 persone, il che rappresenta un aumento del 25% rispetto a sei mesi fa. I dati sono pubblicati come dominio pubblico (CC0). I set proposti possono essere utilizzati nei sistemi di apprendimento automatico per costruire modelli di riconoscimento e sintesi vocale.

Rispetto all'aggiornamento precedente, la quantità di materiale vocale nella collezione è aumentata da 9 a 13,9 mila ore di registrazioni. Il numero di lingue supportate è passato da 60 a 76, con l'aggiunta per la prima volta del supporto per le lingue bielorussa, kazaka, uzbeka, bulgara, armena, azera e bashkira. Il set per la lingua russa comprende 2136 partecipanti e 173 ore di materiale vocale (rispetto ai 1412 partecipanti e 111 ore precedenti), mentre per la lingua ucraina ci sono 615 partecipanti e 66 ore (rispetto ai 459 partecipanti e 30 ore).

Nella preparazione dei materiali in lingua inglese hanno partecipato oltre 75.000 persone, che hanno registrato 2637 ore di parlato confermato (rispetto ai 66.000 partecipanti e 1686 ore precedenti). È interessante notare che al secondo posto per quantità di dati accumulati si trova la lingua rwandese, con 2260 ore raccolte. Seguono il tedesco (1040), il catalano (920) e l'esperanto (840). Tra le lingue che stanno accumulando rapidamente dati vocali, si segnalano il tailandese (cresciuto di 20 volte, da 12 a 250 ore), la luganda (da 8 a 80 ore), l'esperanto (da 100 a 840 ore) e il tamil (da 24 a 220 ore).

Nell'ambito della sua partecipazione al progetto Common Voice, NVIDIA ha preparato modelli pre-addestrati basati sui dati raccolti per sistemi di apprendimento automatico (supportati da PyTorch). I modelli sono distribuiti come parte degli strumenti gratuiti e open source di NVIDIA NeMo, già utilizzati, ad esempio, nei servizi vocali automatizzati di MTS e Sberbank. I modelli sono orientati all'uso in sistemi di riconoscimento vocale, sintesi vocale e elaborazione del linguaggio naturale, e possono risultare utili per i ricercatori che sviluppano sistemi di dialogo vocali, piattaforme di trascrizione e call center automatizzati. A differenza dei progetti disponibili in precedenza, i modelli pubblicati non si limitano al riconoscimento della lingua inglese e coprono diverse lingue, accenti e forme di parlato.

Ricordiamo che il progetto Common Voice ha come obiettivo l'organizzazione della collaborazione per accumulare un database di modelli vocali che tenga conto di tutta la varietà di voci e modi di parlare. Gli utenti sono invitati a vocalizzare le frasi visualizzate sullo schermo o a valutare la qualità dei dati aggiunti da altri utenti. Il database accumulato, con registrazioni di diverse pronunce di frasi standard del parlato umano, può essere utilizzato senza restrizioni nei sistemi di apprendimento automatico e nei progetti di ricerca.

Secondo l'autore della libreria di riconoscimento della parola continua Vosk, le carenze del set di Common Voice risiedono nell'unilateralità del materiale vocale (prevalenza di uomini di età compresa tra 20 e 30 anni e carenza di materiale con voci di donne, bambini e anziani), nella mancanza di varietà nel vocabolario (ripetizione delle stesse frasi) e nella diffusione di registrazioni in formato MP3 che introducono distorsioni.

Fonte: opennet.ru

Acquista hosting affidabile per siti web con protezione DDoS, server VPS VDS 🔥 Acquista hosting affidabile per siti web con protezione DDoS, server VPS VDS | ProHoster