Mozilla on uuendanud Common Voice'i hääldata kogumeid, mis sisaldavad üle 200 000 inimese hääldusnäidet. Andmed on avalikult kättesaadavad (CC0). Pakutavaid kogumeid saab kasutada masinõppe süsteemides kõne- ja sünteeshäälemudelite loomiseks. Võrreldes eelmise uuendusega on kõnematerjali maht kollektsioonis kasvanud 31,1–31,8 tuhandest tunnist, millest 20,8 tuhat tundi on läbinud kontrollimise. Toetatud keelte arv on suurenenud 124-lt 129-le (lisatud on afrikaanide keeled kosa, kalenjin, kiadavida, doluoa ja tswana).
Inglise keele materjalide ettevalmistamisel osales 93,3 tuhat inimest, kes dikteerisid 3554 tundi kõnet (eelmine kord osales 92,3 tuhat inimest ja 3508 tundi). Valgevene keele kogumis on 8400 osalejat ja 1815 tundi kõnematerjali (eelmine kord oli 8291 osalejat ja 1766 tundi), vene keele kogumis on 3241 osalejat ja 277 tundi (eelmine kord 3206 osalejat ja 274 tundi), usbeki keele kogumis on 2189 osalejat ja 265 tundi (eelmine kord 2170 osalejat ja 264 tundi), Ukraina keele kogumis on 1091 osalejat ja 113 tundi (eelmine kord 1075 osalejat ja 112 tundi).
Common Voice projekt on suunatud koostöö korraldamisele häälemustrite andmebaasi kogumiseks, mis arvestab kõigi häältüüride ja kõneviisidega. Kasutajatele pakutakse ekraanile kuvatud fraaside hääldamist või teiste kasutajate lisatud andmete kvaliteedi hindamist. Kogutud andmebaasi, mis sisaldab erineva hääldusega tüüpfraase inimkõnest, saab piiranguteta kasutada masinõppe süsteemides ja teadusprojektides.
Allikas: opennet.ru
