Companiile NVIDIA și Mozilla au lansat o actualizare a seturilor de date vocale, adunate în cadrul inițiativei Common Voice și incluzând exemple de pronunție ale 182 de mii de oameni, cu 25% mai mult decât acum 6 luni. Datele sunt publicate ca domeniu public (CC0). Seturile propuse pot fi utilizate în sisteme de învățare automată pentru construirea de modele de recunoaștere și sinteză vocală.
Comparativ cu actualizarea anterioară, volumul materialului de vorbire din colecție a crescut de la 9 la 13,9 mii ore de vorbire. Numărul limbilor suportate a crescut de la 60 la 76, inclusiv pentru prima dată s-a adăugat suport pentru limbile belarusă, kazahă, uzbecă, bulgară, armeană, azeră și bașkiră. Setul pentru limba rusă acoperă 2136 de participanți și 173 de ore de material vocal (fuseseră 1412 participanți și 111 ore), iar pentru limba ucraineană — 615 participanți și 66 de ore (fuseseră 459 de participanți și 30 de ore).
În pregătirea materialelor în limba engleză au participat peste 75 de mii de persoane, dictând 2637 de ore de vorbire confirmată (fuseseră 66 de mii de participanți și 1686 de ore). Interesant este că pe locul doi în ceea ce privește volumul datelor adunate se află limba ruandă, pentru care s-au strâns 2260 de ore. Urmează germana (1040), catalana (920) și esperanto (840). Printre limbile care acumulează cel mai rapid date vocale se numără limba thailandeză (creștere de 20 de ori, de la 12 la 250 de ore), luanda (de la 8 la 80 de ore), esperanto (de la 100 la 840 de ore) și limba tamilă (de la 24 la 220 de ore).
În cadrul participării sale la proiectul Common Voice, compania NVIDIA a pregătit modele pregătite pentru sisteme de învățare automată (ceea ce este susținut de PyTorch) pe baza datelor colectate. Modelele sunt disponibile ca parte a instrumentarului gratuit și deschis NVIDIA NeMo, care, de exemplu, este deja utilizat în serviciile vocale automate ale MTS și Sberbank. Modelele sunt orientate spre utilizarea în sisteme de recunoaștere vocală, sinteză vocală și procesare a informației în limbaj natural și ar putea fi utile pentru cercetătorii care se ocupă cu crearea de sisteme de dialog vocal, platforme de transcriere și centre de apel automatizate. Spre deosebire de proiectele disponibile anterior, modelele publicate nu se limitează la recunoașterea limbii engleze și acoperă diverse limbi, accente și forme de vorbire.
Reamintim că proiectul Common Voice vizează organizarea unei colaborări în vederea acumulării unei baze de șabloane vocale, ținând cont de toată diversitatea vocilor și manerelor de vorbire. Utilizatorii sunt invitați să vocalizeze frazele afișate pe ecran sau să evalueze calitatea datelor adăugate de alți utilizatori. Baza de date acumulată cu înregistrări ale pronunției variate a frazelor uzuale ale vorbirii umane poate fi utilizată fără restricții în sistemele de învățare automată și în proiecte de cercetare.
Conform autorului bibliotecii de recunoaștere a vorbirii continue Vosk, dezavantajele setului Common Voice sunt unidimensionalitatea materialului vocal (predominanța bărbaților cu vârste între 20 și 30 de ani și lipsa materialului cu voci de femei, copii și persoane în vârstă), lipsa de variabilitate a vocabularului (repetarea acelorași fraze) și distribuția înregistrărilor într-un format MP3 care introduce distorsiuni.
Sursa: opennet.ro
