Kompania Mozilla ka përditësuar grupet e të dhënave të zërit Common Voice, që përfshijnë shembuj të shqiptimit nga më shumë se 200 mijë njerëz. Të dhënat janë publikuar si pronë e përgjithshme (CC0). Grumbujt e propozuar mund të përdoren në sistemet e mësimit të makinerive për ndërtimin e modeleve të njohjes dhe sintezës së zërit. Krahasuar me përditësimin e kaluar, volumi i materialeve të zërit në koleksion u rrit nga 28.7 në 30.3 mijë orë zë, nga të cilat 19.7 mijë orë kaluan procedurën e verifikimit. Numri i gjuhëve të mbështetura u rrit nga 114 në 120 (u shtuan idish, latgalik, ligurian, ossetian, telugu dhe nauatl të perëndimshëm siierra-pueblan).
Në përgatitjen e materialeve në gjuhën angleze morën pjesë 90.67 mijë njerëz, që diktuan 3438 orë zëri (ishin 88.9 mijë pjesëmarrës dhe 3347 orë). Grupi për gjuhën belaruse përfshin 8249 pjesëmarrës dhe 1641 orë material zëri (ishin - 8205 pjesëmarrës dhe 1632 orë), për gjuhën ruse - 3133 pjesëmarrës dhe 265 orë (ishin 3053 pjesëmarrës dhe 260 orë), për gjuhën uzbeke - 2151 pjesëmarrës dhe 264 orë (ishin 2141 pjesëmarrës dhe 263 orë), për gjuhën ukrainase - 1058 pjesëmarrës dhe 108 orë (ishin 1024 pjesëmarrës dhe 105 orë).
Projekti Common Voice ka për qëllim organizimin e punës së përbashkët për akumulimin e një baze të shembujve të zërit, duke pasur parasysh të gjithë diversitetin e zërit dhe mënyrave të të folurit. Përdoruesit ofrohen të shqiptojnë frazat e shfaqura në ekran ose të vlerësojnë cilësinë e të dhënave të shtuar nga përdorues të tjerë. Baza e të dhënave e akumuluar me regjistrime të shqiptimit të frazave tipike të të folurit njerëzor, pa kufizime, mund të përdoret në sistemet e mësimit të makinerive dhe në projekte kërkimore.
Burimi: opennet.ru
