NVIDIA ja Mozilla tutvustasid hÀÀlainete komplektide uuendust, mis on kogutud Common Voice algatuse raames ja sisaldavad 182 000 inimese hÀÀldusnÀidet, mis on 25% rohkem kui kuue kuu eest. Andmed on avaldatud kui avalik domeen (CC0). Pakutavaid komplekte saab kasutada masinÔppes kÔnetuvastuse ja genereerimise mudelite loomisel.
VĂ”rreldes eelmise uuendusega on kĂ”nematerjali maht kollektsioonis suurenenud 9-st 13,9 tuhandeni. Toetatud keelte arv on kasvanud 60-lt 76-le, sealhulgas on esmakordselt lisatud Valgevene, Kasahhi, Usbeki, Bulgaaria, Armeenia, AserbaidĆŸaani ja BaĆĄkiri keele toetus. Vene keele komplekt katab 2136 osalejat ja 173 tundi kĂ”nematerjali (oli 1412 osalejat ja 111 tundi), ning Ukraina keele jaoks 615 osalejat ja 66 tundi (oli 459 osalejat ja 30 tundi).
In English material preparation, over 75,000 people contributed, recording 2,637 hours of verified speech (there were 66,000 participants and 1,686 hours). Interestingly, the second language by the volume of data accumulated is Kinyarwanda, with 2,260 hours gathered. It is followed by German (1,040), Catalan (920), and Esperanto (840). Among the languages experiencing the most dynamic growth in voice data, Thai shows significant growth (20-fold increase, from 12 to 250 hours), Luganda (from 8 to 80 hours), Esperanto (from 100 to 840 hours), and Tamil (from 24 to 220 hours).
Common Voice projektis osaledes valmistas NVIDIA vĂ€lja valmis treenitud mudelid, mis pĂ”hinevad kogutud andmetel ja on mĂ”eldud masinĂ”ppesĂŒsteemide jaoks (toetab PyTorch). Mudelid on osa tasuta ja avatud tööriistadest NVIDIA NeMo, mida nĂ€iteks juba kasutavad MTS ja Sberbank automatiseeritud hÀÀltehnoloogia teenused. Mudelid on suunatud kĂ”netuvastus-, kĂ”nesĂŒnteesi- ja loomuliku keele töötlemise sĂŒsteemidesse ning vĂ”ivad olla kasulikud teadlastele, kes tegelevad hÀÀlte dialoogisĂŒsteemide, transkriptsiooniplatvormide ja automatiseeritud kĂ”nekeskuste loomisega. Erinevalt varasematest projektidest ei piira avaldatud mudelid ainult ingliskeelset kĂ”net, vaid katavad erinevaid keeli, aktsente ja kĂ”neviise.
Tuletud, et projekt Common Voice keskendub koostöö korraldamisele hÀÀlskeemide kogumise osas, arvestades hÀÀle ja kĂ”neviisi mitmekesisust. Kasutajatele pakutakse ekraanil kuvatud lauset hÀÀletada vĂ”i hinnata teiste kasutajate lisatud andmete kvaliteeti. Kogutud andmebaasi, mis sisaldab erineva hÀÀlduse inimkĂ”ne tĂŒĂŒpiliste fraaside salvestisi ilma piiranguteta, saab kasutada masinĂ”ppesĂŒsteemides ja teadusprojektides.
Vosk hÀÀltuvuse teeki autori arvates on Common Voice'i andmekogumi puudusteks hÀÀlematerjali ĂŒhekĂŒlgsus (noorte meeste ĂŒlekaal 20-30 aastat, samuti naiste, laste ja vanemate inimeste hÀÀlte puudus), sĂ”navara varieerumatuse puudumine (samade fraaside kordamine) ja salvestuste levik moonutava MP3 formaadini.
Allikas: opennet.ru
