Mozilla ettevĂ”te vĂ€rskendas Common Voice hÀÀldata komplekte, mis sisaldavad ĂŒle 200 000 inimese hÀÀldusnĂ€ite. Andmed on avaldatud avaliku omandina (CC0). Pakutavaid komplekte saab kasutada masinĂ”ppe sĂŒsteemides kĂ”ne ja sĂŒnteesi mudelite loomiseks. Eelmise vĂ€rskendusega vĂ”rreldes on kĂ”nematerjali maht kollektsioonis suurenenud 28,7-st 30,3 tuhandeni, millest 19,7 tuhat tundi on lĂ€binud kontrollimise protsessi. Toetatud keelte arv on suurenenud 114-lt 120-le (lisasid jidiĆĄi, lÀÀne-lĂ€tikeelse, liigurikeelse, osseedi, telugu ja lÀÀne-sierra-pueblase nahuatli).
Materjalide ettevalmistamisel inglise keeles osales 90,67 tuhat inimest, kes dikteerisid 3438 tundi kĂ”net (osalejaid oli varem 88,9 tuhat ja 3347 tundi). Valgevene keele komplekt hĂ”lmab 8249 osalejat ja 1641 tunni kĂ”nematerjali (varem oli 8205 osalejat ja 1632 tundi), vene keeles â 3133 osalejat ja 265 tundi (varem oli 3053 osalejat ja 260 tundi), usbeki keeles â 2151 osalejat ja 264 tundi (varem 2141 osalejat ja 263 tundi), ukraina keeles â 1058 osalejat ja 108 tundi (varem oli 1024 osalejat ja 105 tundi).
Common Voice projekt on suunatud koostöö korraldamisele hÀÀlemustrite andmebaasi kogumiseks, mis arvestab kĂ”igi hÀÀltĂŒĂŒride ja kĂ”neviisidega. Kasutajatele pakutakse ekraanile kuvatud fraaside hÀÀldamist vĂ”i teiste kasutajate lisatud andmete kvaliteedi hindamist. Kogutud andmebaasi, mis sisaldab erineva hÀÀldusega tĂŒĂŒpfraase inimkĂ”nest, saab piiranguteta kasutada masinĂ”ppe sĂŒsteemides ja teadusprojektides.
Allikas: opennet.ru
