Kompania Mozilla ka pĂ«rmirĂ«suar koleksionet e tĂ« dhĂ«nave tĂ« zĂ«rit Common Voice, tĂ« cilat pĂ«rfshijnĂ« shembuj tĂ« shqiptimit nga mĂ« shumĂ« se 200 mijĂ« njerĂ«z. TĂ« dhĂ«nat janĂ« publikuar si pronĂ« publike (CC0). Koleksionet e propozuara mund tĂ« pĂ«rdoren nĂ« sistemet e mĂ«simit tĂ« makinerive pĂ«r ndĂ«rtimin e modeleve tĂ« njohjes dhe sintesĂ«s sĂ« zĂ«rit. Krahasuar me pĂ«rmirĂ«simin e kaluar, volumi i materialeve tĂ« zĂ«rit nĂ« koleksion Ă«shtĂ« rritur nga 32.6 nĂ« 33.1 mijĂ« orĂ« zĂ«, nga tĂ« cilat 22.1 mijĂ« orĂ« kanĂ« kaluar procesin e verifikimit. Numri i gjuhĂ«ve tĂ« mbĂ«shtetura Ă«shtĂ« rritur nga 129 nĂ« 133 â janĂ« shtuar gjuhĂ«t aragones, isindebele, sothos jugor dhe tupuri.
NĂ« pĂ«rgatitjen e materialeve nĂ« anglisht janĂ« marrĂ« pjesĂ« 94.9 mijĂ« njerĂ«z, duke regjistruar 3631 orĂ« zĂ«ri (ishin 93.9 mijĂ« pjesĂ«marrĂ«s dhe 3587 orĂ«). Koleksioni pĂ«r gjuhĂ«n belaruse mbulon 8521 pjesĂ«marrĂ«s dhe 1860 orĂ« material zĂ«ri (ishin 8444 pjesĂ«marrĂ«s dhe 1846 orĂ«), pĂ«r gjuhĂ«n ruse â 3365 pjesĂ«marrĂ«s dhe 281 orĂ« (ishin 3296 pjesĂ«marrĂ«s dhe 278 orĂ«), pĂ«r gjuhĂ«n uzbeke â 2211 pjesĂ«marrĂ«s dhe 265 orĂ« (ishin 2200 pjesĂ«marrĂ«s dhe 265 orĂ«), pĂ«r gjuhĂ«n ukrainase â 1120 pjesĂ«marrĂ«s dhe 114 orĂ« (ishin 1104 pjesĂ«marrĂ«s dhe 114 orĂ«).
Projekti Common Voice organizon një bashkëpunim për grumbullimin e një baze të templateve të zërit, duke marrë parasysh të gjithë diversitetin e zërit dhe mënyrave të të folurit. Përdoruesve u ofrohet të lexojnë frazat e shfaqura në ekran ose të vlerësojnë cilësinë e të dhënave të shtuar nga përdoruesit e tjerë. Baza e dhënash e grumbulluar me regjistrime të shqiptimit të frazave tipike të zërit njerëzor mund të përdoret pa kufizime në sistemet e mësimit të makinerive dhe në projekte kërkimore.
Burimi: opennet.ru
