Mozilla esitles Common Voice hÀÀldata kogumite vĂ€rskendust, mis sisaldavad umbes 200 000 inimese hÀÀldusnĂ€idet. Andmed on avaldatud avaliku omandi all (CC0). Pakutavaid kogusid saab kasutada masinĂ”ppe sĂŒsteemides kĂ”ne tuvastamise ja sĂŒnteesi mudelite loomiseks. Eelmise vĂ€rskendusega vĂ”rreldes on kĂ”nematerjali maht kogus suurenenu 30% â 13,9 tuhandelt 18,2 tuhandele kĂ”neaastale. Toetatud keelte arv on suurenenud 67-lt 87-le.
Venekeelne komplekt hĂ”lmab 2452 osalejat ja 193 tunni kĂ”nematerjali (enne oli 2136 osalejat ja 173 tundi), valgevenekeelne komplekt â 6160 osalejat ja 987 tundi (enne â 3831 osalejat ja 356 tundi), ukraina keele oma â 684 osalejat ja 76 tundi (enne 615 osalejat ja 66 tundi). Ingliskeelsete materjalide ettevalmistamisel osales ĂŒle 79 000 inimese, kes dikteerisid 2886 tunni kinnitatud kĂ”net (enne oli 75 000 osalejat ja 2637 tundi).
Tuletame meelde, et Common Voice'i projekt eesmĂ€rk on korraldada koostööd hÀÀlematerjalide kogumise alal, arvestades hÀÀle ja kĂ”neviisi mitmekesisust. Kasutajatele pakutakse vĂ”imalust hÀÀldada ekraanil kuvatavaid lauseid vĂ”i hinnata teiste kasutajate lisatud andmete kvaliteeti. Kogutud andmebaasi, mis sisaldab erineva hÀÀldusega tĂŒĂŒpiliste inimkĂ”ne fraaside salvestusi, saab piiramatus koguses kasutada masinĂ”ppe sĂŒsteemides ja teadusprojektides. Vosk hÀÀletuvastuse raamatukogu autori arvates on Common Voice'i komplekti puudused hÀÀlematerjalide ĂŒhekĂŒlgsus (ĂŒlemuslikud on 20-30-aastased mehed ning puuduvad naiste, laste ja eakate hÀÀled), sĂ”navara variatiivsuse puudumine (korduvad samad fraasid) ning salvestuste levik moonutusi tekitavas MP3 formaadis.
Lisaks tasub mainida NVIDIA NeMo 1.6 tööriistade vabastamist, mis pakub masinĂ”ppe meetodeid kĂ”ne tuvastamise, kĂ”ne sĂŒnteesi ja loomuliku keele töötlemise sĂŒsteemide loomiseks. NeMo sisaldab valmis harjutatud mudeleid, mis toetavad masinĂ”ppesĂŒsteeme PyTorchi raamistikul, mille on ette valmistanud NVIDIA, kasutades Common Voice kĂ”nedataandust, hĂ”lmates erinevaid keeli, aktsente ja kĂ”ne vorme. Need mudelid vĂ”ivad olla kasulikud teadlastele, kes töötavad kĂ”nedialooge sĂŒsteemide, transkriptsiooniplatvormide ja automatiseeritud kĂ”nekeskuste loomisega. NĂ€iteks kasutatakse NVIDIA NeMo automatiseeritud hÀÀlteenustes MTS-i ja Sberbanki poolt. NeMo kood on kirjutatud Pythonis, kasutades PyTorchi ja levitatakse Apache 2.0 litsentsi alusel.
Allikas: opennet.ru
