Mozilla on värskendanud Common Voice häälandmete komplekte, mis sisaldavad üle 200 000 inimese hääldusnäidet. Andmed on avaldatud avaliku omandina (CC0). Pakutavaid komplekte saab kasutada masinõppe süsteemides kõnetuvastus- ja sünteesis mudelite loomiseks. Võrreldes eelmise uuendusega on kõnematerjali hulk kogus suurenenud 31,8 tuhandelt 32,6 tuhandeni, millest üle 20 000 tunni on läbinud kontrollimise. Toetatud keeltekogus on suurenenud 129-lt 131-le.
Inglise keele materjalide ettevalmistamises osales 93,9 tuhat inimest, kes dikteerisid 3587 tundi kõnet (eelnevalt oli 93,3 tuhat osalejat ja 3554 tundi). Valgevene keele komplekt hõlmab 8444 osalejat ja 1846 tundi kõnematerjali (eelmisel korral oli 8400 osalejat ja 1815 tundi), vene keele puhul 3296 osalejat ja 278 tundi (eelnevalt 3241 osalejat ja 277 tundi), usbeki keele puhul 2200 osalejat ja 265 tundi (eelnevalt 2189 osalejat ja 265 tundi), ning ukraina keele puhul 1104 osalejat ja 114 tundi (eelnevalt 1091 osalejat ja 113 tundi).
Common Voice projekt on suunatud koostöö korraldamisele häälešabloonide andmebaasi kogumisel, arvestades erinevaid hääli ja kõnemaneere. Kasutajatele pakutakse ekraanile kuvatud fraaside hääldamist või teiste kasutajate lisatud andmete kvaliteedi hindamist. Kogutud andmebaasi, mis sisaldab erinevate hääldustega tüüpfraaside salvestisi, saab piiranguteta kasutada masinõppe süsteemides ja uurimisprojektides.
Allikas: opennet.ru
