Kompania Mozilla ka përditësuar setet e të dhënave zanore Common Voice, duke përfshirë shembuj shqiptimi nga më shumë se 200,000 njerëz. Të dhënat janë publikuar si pronë publike (CC0). Setet e propozuara mund të përdoren në sistemet e mësimit të makinerive për ndërtimin e modeleve të njohjes dhe sintesisë së zërit. Krahasuar me përditësimin e kaluar, sasia e materialeve zanore në koleksion është rritur nga 31.8 në 32.6 mijë orë zëri, nga të cilat mbi 20 mijë orë kanë kaluar procesin e verifikimit. Numri i gjuhëve të mbështetur është rritur nga 129 në 131.
Në përgatitjen e materialeve në anglisht kanë marrë pjesë 93.9 mijë njerëz, të cilët kanë regjistruar 3587 orë zëri (isha 93.3 mijë pjesëmarrës dhe 3554 orë). Seti për gjuhën belaruse pokakton 8444 pjesëmarrës dhe 1846 orë materiale zanore (isha - 8400 pjesëmarrës dhe 1815 orë), për gjuhën ruse - 3296 pjesëmarrës dhe 278 orë (isha 3241 pjesëmarrës dhe 277 orë), për gjuhën uzbeke - 2200 pjesëmarrës dhe 265 orë (isha 2189 pjesëmarrës dhe 265 orë), për gjuhën ukrainase - 1104 pjesëmarrës dhe 114 orë (isha 1091 pjesëmarrës dhe 113 orë).
Projekti Common Voice ka për qëllim organizimin e punës së përbashkët për akumulimin e një baze të shembujve të zërit, duke pasur parasysh të gjithë diversitetin e zërit dhe mënyrave të të folurit. Përdoruesit ofrohen të shqiptojnë frazat e shfaqura në ekran ose të vlerësojnë cilësinë e të dhënave të shtuar nga përdorues të tjerë. Baza e të dhënave e akumuluar me regjistrime të shqiptimit të frazave tipike të të folurit njerëzor, pa kufizime, mund të përdoret në sistemet e mësimit të makinerive dhe në projekte kërkimore.
Burimi: opennet.ru
