Le aziende NVIDIA e Mozilla hanno presentato un aggiornamento dei set di dati vocali, raccolti nell'ambito dell'iniziativa Common Voice e includenti esempi di pronuncia di 182 mila persone, il che rappresenta un incremento del 25% rispetto a sei mesi fa. I dati sono stati pubblicati come dominio pubblico (CC0). I set proposti possono essere utilizzati in sistemi di apprendimento automatico per costruire modelli di riconoscimento e sintesi vocale.
Rispetto all'aggiornamento precedente, la quantità di materiale vocale nella raccolta è aumentata da 9 a 13,9 mila ore di parlato. Il numero di lingue supportate è salito da 60 a 76, tra cui per la prima volta è stata aggiunta la supporto per le lingue bielorussa, kazaka, uzbeka, bulgara, armena, azera e bashkira. Il set per la lingua russa include 2136 partecipanti e 173 ore di materiale vocale (rispetto a 1412 partecipanti e 111 ore), mentre per la lingua ucraina comprende 615 partecipanti e 66 ore (rispetto a 459 partecipanti e 30 ore).
Nella preparazione dei materiali in lingua inglese hanno partecipato più di 75 mila persone, che hanno registrato 2637 ore di parlato confermato (rispetto a 66 mila partecipanti e 1686 ore). Interessante notare che al secondo posto per dimensione dei dati accumulati c'è la lingua ruanda, per la quale sono state raccolte 2260 ore. Seguono il tedesco (1040), il catalano (920) e l'esperanto (840). Le lingue che stanno aumentando più rapidamente la dimensione dei dati vocali includono il tailandese (crescita della base di 20 volte, da 12 a 250 ore), il luganda (da 8 a 80 ore), l'esperanto (da 100 a 840 ore) e il tamil (da 24 a 220 ore).
Nel contesto della sua partecipazione al progetto Common Voice, NVIDIA ha preparato modelli già addestrati basati su dati raccolti per sistemi di apprendimento automatico (supporto per PyTorch). I modelli sono distribuiti come parte dell'open toolset gratuito NVIDIA NeMo, che, ad esempio, è già utilizzato nei servizi vocali automatizzati di MTS e Sberbank. I modelli sono orientati all'uso in sistemi di riconoscimento vocale, sintesi vocale e trattamento delle informazioni in linguaggio naturale e possono risultare utili per i ricercatori impegnati nella creazione di sistemi di dialogo vocale, piattaforme di trascrizione e call center automatizzati. A differenza dei progetti disponibili in precedenza, i modelli pubblicati non sono limitati al riconoscimento della lingua inglese e coprono diverse lingue, accenti e forme di espressione.
Ricordiamo che il progetto Common Voice è mirato a organizzare un lavoro collaborativo per accumulare un database di esempi vocali che tenga conto di tutta la varietà di voci e maniere di parlare. Gli utenti sono invitati a registrarne le frasi visualizzate sullo schermo o a valutare la qualità dei dati aggiunti da altri utenti. Il database accumulato con registrazioni di pronunce diverse di frasi standard del linguaggio umano può essere utilizzato senza restrizioni in sistemi di apprendimento automatico e in progetti di ricerca.
Secondo l'autore della libreria di riconoscimento vocale contiguo Vosk, i difetti del set Common Voice sono l'unilateralità del materiale vocale (prevalenza di uomini di età compresa tra i 20 e i 30 anni e mancanza di materiale con voci femminili, infantili e di anziani), l'assenza di variabilità del vocabolario (ripetizione delle stesse frasi) e la diffusione delle registrazioni in un formato MP3 che introduce distorsioni.
Fonte: opennet.ru
