Mozilla on uuendanud Common Voice'i hääldata komplekte, mis sisaldavad hääldusnäiteid enam kui 200 000 inimeselt. Andmed on avaldatud avaliku omandi all (CC0). Pakutavaid komplekte saab kasutada masinõppe süsteemides kõne- ja sünteesi mudelite loomiseks. Mõrku saamata, võrreldes eelmise uuendusega, on kõnematerjali maht kollektsioonis kasvanud 31,1-st 31,8 tuhande tunni peale, millest 20,8 tuhat tundi on läbinud kontrollimisprotsessi. Toetatud keelte arv on tõusnud 124-lt 129-le (lisatud on kosaa, kalendžini, kidaviidi, doluo ja tswana keeled).
Inglise keele materjalide ettevalmistamisel osales 93,3 tuhat inimest, kes dikteerisid 3554 tundi kõnet (osalejaid oli varem 92,3 tuhat ja 3508 tundi). Valgevene keele komplekt hõlmab 8400 osalejat ja 1815 tundi kõnematerjali (varem oli 8291 osalejat ja 1766 tundi), vene keele puhul on osalejaid 3241 ja tunde 277 (varem oli 3206 osalejat ja 274 tundi), usbeki keeles 2189 osalejat ja 265 tundi (varem oli 2170 osalejat ja 264 tundi), ukraina keeles 1091 osalejat ja 113 tundi (varem oli 1075 osalejat ja 112 tundi).
Common Voice projekt on suunatud koostöö korraldamisele häälešabloonide andmebaasi kogumisel, arvestades erinevaid hääli ja kõnemaneere. Kasutajatele pakutakse ekraanile kuvatud fraaside hääldamist või teiste kasutajate lisatud andmete kvaliteedi hindamist. Kogutud andmebaasi, mis sisaldab erinevate hääldustega tüüpfraaside salvestisi, saab piiranguteta kasutada masinõppe süsteemides ja uurimisprojektides.
Allikas: opennet.ru
