Mozilla on värskendanud Common Voice'i hääldata kogumikke, mis sisaldavad hääldusnäiteid üle 200 000 inimese. Andmed on avaldatud avaliku domeeni all (CC0). Pakutavaid kogumeid saab kasutada masinõppe süsteemides kõne tuvastamise ja sünteesi mudelite loomiseks. Varasema värskendusega võrreldes on kõnematerjali maht kollektsioonis suurenenud 28,7-st 30,3 tuhande tunni peale, millest 19,7 tuhat tundi on läbinud kontrollimise. Toetatud keelte arv on suurenenud 114-lt 120-le (lisa on tehtud jidiš, läti, liguuria, osseedi, telugu ja lääne sierra-puebla nahuatli keeled).
In the preparation of materials in English, 90.67 thousand people participated, dictating 3438 hours of speech (there were 88.9 thousand participants and 3347 hours). The set for the Belarusian language includes 8249 participants and 1641 hours of spoken material (there were 8205 participants and 1632 hours), for the Russian language — 3133 participants and 265 hours (there were 3053 participants and 260 hours), for Uzbek — 2151 participants and 264 hours (there were 2141 participants and 263 hours), and for Ukrainian — 1058 participants and 108 hours (there were 1024 participants and 105 hours).
Common Voice projekt on suunatud koostöö korraldamisele häälešabloonide andmebaasi kogumisel, arvestades erinevaid hääli ja kõnemaneere. Kasutajatele pakutakse ekraanile kuvatud fraaside hääldamist või teiste kasutajate lisatud andmete kvaliteedi hindamist. Kogutud andmebaasi, mis sisaldab erinevate hääldustega tüüpfraaside salvestisi, saab piiranguteta kasutada masinõppe süsteemides ja uurimisprojektides.
Allikas: opennet.ru
