Kompania Mozilla ka përmirësuar setet e të dhënave të zërit Common Voice, duke përfshirë shembujt e shqiptimit nga më shumë se 200,000 persona. Të dhënat janë publikuar si pronësi publike (CC0). Setet e propozura mund të përdoren në sisteme mësimi të makinerive për të ndërtuar modele të njohjes dhe sintezës së zërit. Krahasuar me përditësimin e fundit, sasia e materialit të zërit në koleksion është rritur nga 31.1 në 31.8 mijë orë zë, prej të cilave 20.8 mijë orë kanë kaluar procedurën e verifikimit. Numri i gjuhëve të mbështetura është rritur nga 124 në 129 (janë shtuar gjuhët e fisit afrikan, kosa, kalenjin, kidavida, doluo dhe tsvana).
Në përgatitjen e materialeve në anglisht kanë marrë pjesë 93.3 mijë persona, të cilët kanë regjistruar 3554 orë zë (ishin 92.3 mijë pjesëmarrës dhe 3508 orë). Grupi për gjuhën belaruse përfshin 8400 pjesëmarrës dhe 1815 orë material zëri (ishte - 8291 pjesëmarrës dhe 1766 orë), për gjuhën ruse - 3241 pjesëmarrës dhe 277 orë (ishin 3206 pjesëmarrës dhe 274 orë), për gjuhën uzbekisht - 2189 pjesëmarrës dhe 265 orë (ishin 2170 pjesëmarrës dhe 264 orë), për gjuhën ukrainase - 1091 pjesëmarrës dhe 113 orë (ishin 1075 pjesëmarrës dhe 112 orë).
Projekti Common Voice ka si qëllim organizimin e punës së përbashkët për grumbullimin e një baze të shablloneve të zërit që merr parasysh gjithë diversitetin e zërit dhe stilit të shqiptimit. Përdoruesit ftohen të regjistrojnë frazat që shfaqen në ekran ose të vlerësojnë cilësinë e të dhënave të shtuar nga përdoruesit e tjerë. Baza e grumbulluar me regjistrime të shqiptimit të ndryshëm të frazave tipike të zërit të njeriut mund të përdoret pa kufizime në sistemet e mësimit të makinave dhe në projekte kërkimore.
Burimi: opennet.ru
