Mozilla ha presentato un aggiornamento dei suoi set di dati vocali Common Voice, che includono esempi di pronuncia di circa 200.000 persone. I dati sono stati pubblicati come dominio pubblico (CC0). I set proposti possono essere utilizzati nei sistemi di apprendimento automatico per costruire modelli di riconoscimento e sintesi vocale. Rispetto all'aggiornamento precedente, il volume del materiale vocale nella collezione è aumentato del 30% — da 13,9 a 18,2 mila ore di parlato. Il numero delle lingue supportate è aumentato da 67 a 87.
Il set per la lingua russa comprende 2452 partecipanti e 193 ore di materiale vocale (rispetto ai 2136 partecipanti e 173 ore precedenti), per la lingua bielorussa — 6160 partecipanti e 987 ore (rispetto ai 3831 partecipanti e 356 ore), per la lingua ucraina — 684 partecipanti e 76 ore (rispetto ai 615 partecipanti e 66 ore). Nella preparazione dei materiali in lingua inglese hanno partecipato oltre 79.000 persone, che hanno registrato 2886 ore di parlato confermato (rispetto ai 75.000 partecipanti e 2637 ore).
Ricordiamo che il progetto Common Voice è mirato a organizzare una collaborazione per accumulare un database di modelli vocali che tenga conto di tutta la varietà di voci e modi di espressione. Gli utenti sono invitati a registrare le frasi visualizzate sullo schermo oppure a valutare la qualità dei dati aggiunti da altri utenti. Il database accumulato con registrazioni di vari pronunciamenti di frasi tipiche del linguaggio umano, senza restrizioni, può essere utilizzato in sistemi di apprendimento automatico e in progetti di ricerca. Secondo l'autore della libreria di riconoscimento del parlato continuo Vosk, le carenze del set Common Voice sono l'unilateralità del materiale vocale (predominanza di uomini di età compresa tra 20 e 30 anni e mancanza di materiale con voci di donne, bambini e persone anziane), l'assenza di varietà nel vocabolario (ripetizione delle stesse frasi) e la diffusione di registrazioni in formato MP3 che introducono distorsioni.
Inoltre, si segnala il rilascio dello strumento NVIDIA NeMo 1.6, che offre metodi di apprendimento automatico per la creazione di sistemi di riconoscimento vocale, sintesi vocale e elaborazione del linguaggio naturale. NeMo include modelli pre-addestrati per sistemi di machine learning basati sul framework PyTorch, sviluppati da NVIDIA utilizzando i dati vocali di Common Voice, coprendo diverse lingue, accenti e forme di linguaggio. Questi modelli possono essere utili per i ricercatori che lavorano su sistemi di dialogo vocale, piattaforme di trascrizione e call center automatizzati. Ad esempio, NVIDIA NeMo è utilizzato nei servizi vocali automatizzati di MTS e Sberbank. Il codice di NeMo è scritto in Python utilizzando PyTorch ed è distribuito con licenza Apache 2.0.
Fonte: opennet.ru
