Mozilla on vĂ€rskendanud Common Voice'i hÀÀldata kogusid, mis sisaldavad ĂŒle 200 000 inimese hÀÀldusnĂ€ite. Andmed on avaldatud avaliku omandina (CC0). Pakutavaid kogusid saab kasutada masinĂ”ppe sĂŒsteemides kĂ”ne tuvastamise ja sĂŒnteesi mudelite loomiseks. VĂ”rreldes eelmise vĂ€rskendusega kasvas kĂ”nematerjali maht kollektsioonis 32,6 tuhande tunni pealt 33,1 tuhande tunni peale, millest 22,1 tuhat tundi lĂ€bis kontrollimise. Toetatud keelte arv kasvas 129-lt 133-le â lisatud on aragoni, isindebele, lĂ”una-soto ja tupuri keeled.
Inglise keele materjalide ettevalmistamisel osales 94,9 tuhat inimest, kes dikteerisid 3631 tunni kĂ”net (oli 93,9 tuhat osalejat ja 3587 tundi). Valgevene keele kogus hĂ”lmab 8521 osalejat ja 1860 tund kĂ”nematerjali (oli 8444 osalejat ja 1846 tundi), vene keeles â 3365 osalejat ja 281 tundi (oli 3296 osalejat ja 278 tundi), usbeki keeles â 2211 osalejat ja 265 tundi (oli 2200 osalejat ja 265 tundi), ukraina keeles â 1120 osalejat ja 114 tundi (oli 1104 osalejat ja 114 tundi).
Common Voice'i projekt korraldab koostööd hÀÀlemallide andmebaasi kogumisel, arvestades kĂ”ikide hÀÀlte ja kĂ”neviiside mitmekesisust. Kasutajatele pakutakse vĂ”imalust hÀÀldada ekraanil kuvatud lauseid vĂ”i hinnata teiste kasutajate lisatud andmete kvaliteeti. Kogutud andmebaasi erineva hÀÀlduse nĂ€idatud fraasid on piiramatu kasutusega masinĂ”ppe sĂŒsteemides ja uurimisprojektides.
Allikas: opennet.ru
