Kompania Mozilla publikoi njĂ« azhurnim tĂ« grupeve tĂ« tĂ« dhĂ«nave vokale Common Voice, duke pĂ«rfshirĂ« shembuj tĂ« shqiptimit nga rreth 200,000 njerĂ«z. TĂ« dhĂ«nat janĂ« publikuar si pronĂ« publike (CC0). Grupi i propozuar mund tĂ« pĂ«rdoret nĂ« sistemet e mĂ«simit tĂ« makinerive pĂ«r ndĂ«rtimin e modeleve tĂ« njohjes dhe sintezĂ«s sĂ« zĂ«rit. Krahasuar me azhurnimin e kaluar, volume i materialeve vokale nĂ« koleksion ka rritur me 30% â nga 13.9 nĂ« 18.2 mijĂ« orĂ« zĂ«. Numri i gjuhĂ«ve tĂ« mbĂ«shtetura Ă«shtĂ« rritur nga 67 nĂ« 87.
Grupi pĂ«r gjuhĂ«n ruse mbulon 2452 pjesĂ«marrĂ«s dhe 193 orĂ« materiale vokale (ishin 2136 pjesĂ«marrĂ«s dhe 173 orĂ«), pĂ«r gjuhĂ«n belaruse â 6160 pjesĂ«marrĂ«s dhe 987 orĂ« (ishin 3831 pjesĂ«marrĂ«s dhe 356 orĂ«), pĂ«r gjuhĂ«n ukrainase â 684 pjesĂ«marrĂ«s dhe 76 orĂ« (ishin 615 pjesĂ«marrĂ«s dhe 66 orĂ«). NĂ« pĂ«rgatitjen e materialeve nĂ« gjuhĂ«n angleze morĂ«n pjesĂ« mĂ« shumĂ« se 79,000 njerĂ«z, tĂ« cilĂ«t regjistruan 2886 orĂ« zĂ«ri tĂ« konfirmuar (ishin 75,000 pjesĂ«marrĂ«s dhe 2637 orĂ«).
Dëshirojmë t'ju rikujtojmë se projekti Common Voice është i orientuar drejt organizimit të bashkëpunimit për akumulimin e një baze të të dhënave të shabloneve vokale, e cila merr parasysh të gjitha diversitetet e zëra dhe mënyrave të të folurit. Përdoruesve u ofrohet mundësia për të regjistruar frazat që shfaqen në ekran ose për të vlerësuar cilësinë e të dhënave të shtuara nga përdorues të tjerë. Baza e të dhënave e akumuluar me regjistrime të shqiptimit të frazave tipike të gjuhës njerëzore mund të përdoret pa kufizime në sistemet e mësimit të makinerive dhe në projekte kërkimore. Sipas autorit të bibliotekës së njohjes së fjalëve të shkrira Vosk, disavantazhet e grupit Common Voice janë njëanshmëria e materialit vokal (dominimi i meshkujve nga mosha 20-30 vjeç dhe mungesa e materialeve me zëra femrash, fëmijësh dhe të moshuarish), mungesa e variacionit të fjalorit (përsëritja e të njëjtave fraza) dhe shpërndarja e regjistrimeve në një format MP3 që shkakton deformime.
Gjithashtu mund të theksohet publikimi i instrumenteve NVIDIA NeMo 1.6, që ofron metoda të mësimit të makinerisë për krijimin e sistemeve të njohjes së zërit, sintezës së zërit dhe përpunimit të informacionit në gjuhën natyrore. NeMo përfshin modele të trajnuara paraprakisht për sistemet e mësimit të makinerisë bazuar në kuadrin PyTorch, të përgatitura nga kompania NVIDIA me përdorimin e të dhënave të zërit Common Voice dhe përfshijnë gjuhë, akcentë dhe forma të ndryshme të zërit. Modelet mund të jenë të dobishme për studiuesit që merren me krijimin e sistemeve të dialogut me zë, platformave për transkriptim dhe qendra telefonike automatike. Për shembull, NVIDIA NeMo përdoret në shërbimet automatike të zërit të MTS dhe Sberbank. Kodi NeMo është shkruar në gjuhën Python duke përdorur PyTorch dhe shpërndahet nën licencën Apache 2.0.
Burimi: opennet.ru
