Përditësimi i të dhënave të zërit Mozilla Common Voice 18.0.

Kompania Mozilla ka përditësuar setet e të dhënave të zërit Common Voice, që përfshijnë shembuj të shqiptimit nga mbi 200 mijë njerëz. Të dhënat janë publikuar si pronë publike (CC0). Setet e propozuara mund të përdoren në sistemet e mësimit të makinerive për të ndërtuar modele të njohjes dhe sintezës së zërit. Krahasuar me përditësimin e kaluar, volumi i materialit të zërit në koleksion është rritur nga 31.1 në 31.8 mijë orë të zërit, nga të cilat 20.8 mijë orë kanë kaluar procedurën e verifikimit. Numri i gjuhëve të mbështetura është rritur nga 124 në 129 (janë shtuar gjuhët e fisnikeve të Afrikës: kosa, kalenjin, kidavida, doluo dhe tswana).

NĂ« pĂ«rgatitjen e materialeve nĂ« anglisht kanĂ« marrĂ« pjesĂ« 93.3 mijĂ« njerĂ«z, qĂ« kanĂ« diktuar 3554 orĂ« tĂ« zĂ«rit (ishin 92.3 mijĂ« pjesĂ«marrĂ«s dhe 3508 orĂ«). Seti pĂ«r gjuhĂ«n belaruse mbulon 8400 pjesĂ«marrĂ«s dhe 1815 orĂ« materiale zĂ«ri (ishe 8291 pjesĂ«marrĂ«s dhe 1766 orĂ«), pĂ«r gjuhĂ«n ruse — 3241 pjesĂ«marrĂ«s dhe 277 orĂ« (ishin 3206 pjesĂ«marrĂ«s dhe 274 orĂ«), pĂ«r uzbekishten — 2189 pjesĂ«marrĂ«s dhe 265 orĂ« (ishin 2170 pjesĂ«marrĂ«s dhe 264 orĂ«), pĂ«r gjuhĂ«n ukrainase — 1091 pjesĂ«marrĂ«s dhe 113 orĂ« (ishin 1075 pjesĂ«marrĂ«s dhe 112 orĂ«).

Projekti Common Voice ka për qëllim organizimin e punës së përbashkët për akumulimin e një baze të shembujve të zërit, duke pasur parasysh të gjithë diversitetin e zërit dhe mënyrave të të folurit. Përdoruesit ofrohen të shqiptojnë frazat e shfaqura në ekran ose të vlerësojnë cilësinë e të dhënave të shtuar nga përdorues të tjerë. Baza e të dhënave e akumuluar me regjistrime të shqiptimit të frazave tipike të të folurit njerëzor, pa kufizime, mund të përdoret në sistemet e mësimit të makinerive dhe në projekte kërkimore.

Burimi: opennet.ru

Bleni hostim tĂ« besueshĂ«m pĂ«r faqe me mbrojtje nga DDoS, serverĂ« VPS VDS đŸ”„ Bleni hostim tĂ« besueshĂ«m pĂ«r faqe me mbrojtje nga DDoS, serverĂ« VPS VDS | ProHoster