Mozilla on uuendanud Common Voice'i hÀÀldata kogumeid, mis sisaldavad ĂŒle 200 000 inimese hÀÀldusnĂ€idet. Andmed on avalikult kĂ€ttesaadavad (CC0). Pakutavaid kogumeid saab kasutada masinĂ”ppe sĂŒsteemides kĂ”ne- ja sĂŒnteeshÀÀlemudelite loomiseks. VĂ”rreldes eelmise uuendusega on kĂ”nematerjali maht kollektsioonis kasvanud 31,1â31,8 tuhandest tunnist, millest 20,8 tuhat tundi on lĂ€binud kontrollimise. Toetatud keelte arv on suurenenud 124-lt 129-le (lisatud on afrikaanide keeled kosa, kalenjin, kiadavida, doluoa ja tswana).
Inglise keele materjalide ettevalmistamisel osales 93,3 tuhat inimest, kes dikteerisid 3554 tundi kÔnet (eelmine kord osales 92,3 tuhat inimest ja 3508 tundi). Valgevene keele kogumis on 8400 osalejat ja 1815 tundi kÔnematerjali (eelmine kord oli 8291 osalejat ja 1766 tundi), vene keele kogumis on 3241 osalejat ja 277 tundi (eelmine kord 3206 osalejat ja 274 tundi), usbeki keele kogumis on 2189 osalejat ja 265 tundi (eelmine kord 2170 osalejat ja 264 tundi), Ukraina keele kogumis on 1091 osalejat ja 113 tundi (eelmine kord 1075 osalejat ja 112 tundi).
Common Voice projekt on suunatud koostöö korraldamisele hÀÀlemustrite andmebaasi kogumiseks, mis arvestab kĂ”igi hÀÀltĂŒĂŒride ja kĂ”neviisidega. Kasutajatele pakutakse ekraanile kuvatud fraaside hÀÀldamist vĂ”i teiste kasutajate lisatud andmete kvaliteedi hindamist. Kogutud andmebaasi, mis sisaldab erineva hÀÀldusega tĂŒĂŒpfraase inimkĂ”nest, saab piiranguteta kasutada masinĂ”ppe sĂŒsteemides ja teadusprojektides.
Allikas: opennet.ru
