Compania Mozilla a prezentat o actualizare a seturilor de date vocale Common Voice, incluzând exemple de pronunție de la aproximativ 200 de mii de persoane. Datele sunt publicate ca domeniu public (CC0). Seturile propuse pot fi utilizate în sistemele de învățare automată pentru construirea de modele de recunoaștere și sintetizare a vorbirii.
Comparativ cu actualizarea anterioară, volumul materialului vocal din colecție a crescut cu 10% — de la 18,2 la 20,2 mii de ore de vorbire. Numărul limbilor susținute a crescut de la 87 la 93. Pentru 27 de limbi, au fost acumulate mai mult de 100 de ore de date vocale, iar pentru 9 — mai mult de 500 de ore de date vocale. Pentru 9 limbi, s-a reușit, de asemenea, obținerea unei proporții de vorbire feminină de cel puțin 45%.
În pregătirea materialelor în limba engleză au participat peste 81 de mii de persoane, care au dictat 2953 de ore de vorbire (erau 79 de mii de participanți și 2886 de ore). Setul pentru limba belarusă acoperă 6326 de participanți și 1054 de ore de material vocal (erau 6160 de participanți și 987 de ore), limba rusă — 2585 de participanți și 201 ore (erau 2452 de participanți și 193 de ore), limba uzbecă — 1503 participanți și 231 de ore (erau 1355 de participanți și 227 de ore), limba ucraineană — 696 de participanți și 79 de ore (erau 684 de participanți și 76 de ore).
Proiectul Common Voice vizează organizarea unei colaborări pentru acumularea unei baze de șabloane vocale, care să reflecte toată diversitatea vocii și a stilurilor de vorbire. Utilizatorii sunt încurajați să dicteze frazele afișate pe ecran sau să evalueze calitatea datelor adăugate de alți utilizatori. Baza de date acumulată, cu înregistrări ale diverselor pronunții ale frazelor uzuale ale vorbitorilor, poate fi utilizată fără restricții în sistemele de învățare automată și în proiecte de cercetare.
Sursa: opennet.ro
