EttevĂ”tted NVIDIA ja Mozilla esitlesid Common Voice'i algatuse raames kogutud hÀÀldusandmete komplektide uuendust, mis sisaldab 182 000 inimese hÀÀldusnĂ€ite, see on 25% rohkem kui 6 kuud tagasi. Andmed on avalikult kĂ€ttesaadavad (CC0). Pakutavaid komplekte saab kasutada masinĂ”ppe sĂŒsteemides kĂ”netuvastuse ja -sĂŒntesi mudelite rajamiseks.
VĂ”rreldes eelmise uuendusega kasvas kĂ”nematerjali maht kogus 9-lt 13,9 tuhandeni tunni hÀÀlt. Toetatavate keelte arv kasvas 60-lt 76-le, sealhulgas esmakordselt lisandus valgevene, kasahhi, usbeki, bulgaaria, armeenia, aserbaidĆŸaani ja baĆĄkiiri keeled. Vene keele komplekt katab 2136 osalejat ja 173 tundi kĂ”nematerjali (oli 1412 osalejat ja 111 tundi), ning ukraina keele osas 615 osalejat ja 66 tundi (oli 459 osalejat ja 30 tundi).
Inglise keeles materjalide ettevalmistamises osales ĂŒle 75 000 inimese, kes dikteerisid 2637 tundi kinnitatud kĂ”net (oli 66 000 osalejat ja 1686 tundi). Huvitav, et teisel kohal andmemahtude poolest on ruanda keel, millel on kogutud 2260 tundi. JĂ€rgmistena on saksa (1040), katalaani (920) ja esperanto (840). KĂ”neandmete kiiresti kasvavate keelte seas mainitakse tai keelt (andmemaht kasvas 20 korda, 12-tunnilt 250 tunnile), luganda (8-lt 80 tunnile), esperanto (100-lt 840 tunnile) ja tamili keelt (24-lt 220 tunnile).
Oma panuse raames projektis Common Voice on ettevĂ”te NVIDIA koostanud koolitatud mudelid, mis on loodud kogutud andmete pĂ”hjal masinĂ”ppe sĂŒsteemide jaoks (toetab PyTorch). Mudelid levitatakse tasuta ja avatud tööriistade komplektis NVIDIA NeMo, mida kasutatakse nĂ€iteks MTS ja Sberbanki automatiseeritud kĂ”neservises. Mudelid on suunatud kĂ”netuvastuse, kĂ”nesĂŒnteesi ja loomuliku keele töötlemise sĂŒsteemide kasutamiseks ning need vĂ”ivad olla kasulikud teadlastele, kes tegelevad hÀÀldusdialoogisĂŒsteemide, transkribeerimisplatvormide ja automatiseeritud kĂ”nekeskuste loomisega. Erinevalt varasemalt kergesti kĂ€ttesaadavatest projektidest ei piira avaldatud mudelid ennast inglise keele tuvastamisega, vaid hĂ”lmavad erinevaid keeli, aktsente ja kĂ”nevorme.
Tuletame meelde, et projekt Common Voice keskendub koostöö korraldamisele hÀÀlte mallide kogumiseks, arvestades kĂ”igi hÀÀlte ja kĂ”nemaneeride mitmekesisust. Kasutajatele pakutakse vĂ”imalust hÀÀldada ekraanile kuvatavaid lauseid vĂ”i hinnata teiste kasutajate lisatud andmete kvaliteeti. Kogutud andmebaasi, kus on erineva hÀÀldusega tĂŒĂŒpiliste lausete salvestused, saab piiramata kasutada masinĂ”ppe sĂŒsteemides ja teadusprojektides.
Vosk kĂ”netuvastuse raamatukogu autori sĂ”nul on Common Voice'i andmekogumi puuduseks ĂŒhekĂŒlgsus hÀÀlte materjalis (enamuses on mehed vanuses 20-30 aastat ja puuduvad naiste, laste ja vanurite hÀÀlte materjalid), sĂ”navara variatiivsuse puudumine (korduvad samad fraasid) ja salvestuste levitamine moonutatud MP3 formaadis.
Allikas: opennet.ru
