Përditësimi i të dhënave të zërit Mozilla Common Voice 8.0

Kompania Mozilla prezantoi njĂ« pĂ«rditĂ«sim tĂ« grupeve tĂ« tĂ« dhĂ«nave vokale Common Voice, duke pĂ«rfshirĂ« shembuj tĂ« shqiptimi nga rreth 200,000 njerĂ«z. TĂ« dhĂ«nat janĂ« publikuar si pronĂ« publike (CC0). Grupid e propozuara mund tĂ« pĂ«rdoren nĂ« sistemet e mĂ«simit tĂ« makinave pĂ«r ndĂ«rtimin e modeleve tĂ« njohjes dhe sintetizimit tĂ« zĂ«rit. Krahasuar me pĂ«rditĂ«simin e kaluar, volumi i materialeve vokale nĂ« koleksion Ă«shtĂ« rritur me 30% — nga 13.9 nĂ« 18.2 mijĂ« orĂ« zĂ«ri. Numri i gjuhĂ«ve tĂ« mbĂ«shtetura u rrit nga 67 nĂ« 87.

Grupi pĂ«r gjuhĂ«n ruse mbulon 2452 pjesĂ«marrĂ«s dhe 193 orĂ« materiale vokale (ishin 2136 pjesĂ«marrĂ«s dhe 173 orĂ«), pĂ«r gjuhĂ«n belaruse — 6160 pjesĂ«marrĂ«s dhe 987 orĂ« (ishte — 3831 pjesĂ«marrĂ«s dhe 356 orĂ«), pĂ«r gjuhĂ«n ukrainase — 684 pjesĂ«marrĂ«s dhe 76 orĂ« (ishin 615 pjesĂ«marrĂ«s dhe 66 orĂ«). NĂ« pĂ«rgatitjen e materialeve nĂ« gjuhĂ«n angleze morĂ«n pjesĂ« mĂ« shumĂ« se 79 mijĂ« njerĂ«z, qĂ« regjistruan 2886 orĂ« zĂ«ri tĂ« verifikuar (ishin 75 mijĂ« pjesĂ«marrĂ«s dhe 2637 orĂ«).

KujtojmĂ« se projekti Common Voice ka si qĂ«llim organizimin e bashkĂ«punimit pĂ«r grumbullimin e njĂ« baze tĂ« ßablonĂ«ve vokalĂ«, duke u marrĂ« parasysh tĂ« gjitha larmitĂ« e zĂ«rave dhe stilit tĂ« tĂ« folurit. PĂ«rdoruesve u propozohet tĂ« lexojnĂ« frazat e shfaqura nĂ« ekran ose tĂ« vlerĂ«sojnĂ« cilĂ«sinĂ« e tĂ« dhĂ«nave tĂ« shtuar nga pĂ«rdorues tĂ« tjerĂ«. Baza e tĂ« dhĂ«nave e grumbulluar me regjistrime tĂ« shqiptimit tĂ« frazave standarde tĂ« tĂ« folurit njerĂ«zor pa kufizime mund tĂ« pĂ«rdoret nĂ« sistemet e mĂ«simit tĂ« makinave dhe nĂ« projekte kĂ«rkimore. Sipas autorit tĂ« bibliotekĂ«s sĂ« njohjes sĂ« tĂ« folurit tĂ« lidhur Vosk, disavantazhet e grupit Common Voice janĂ« njĂ«anshmĂ«ria e materialeve vokale (dominuar nga meshkujt 20-30 vjeç, dhe mungesa e materialeve me zĂ«ra tĂ« grave, fĂ«mijĂ«ve dhe personave tĂ« moshuar), mungesa e variabilitetit tĂ« fjalorit (pĂ«rsĂ«ritja e tĂ« njĂ«jtave fraza) dhe shpĂ«rndarja e regjistrimeve nĂ« njĂ« format MP3 qĂ« shkakton distortime.

Përveç kësaj, mund të theksohet lëshimi i mjeteve NVIDIA NeMo 1.6, që ofrojnë metoda të mësimit të makinerisë për krijimin e sistemeve të njohjes së zërit, sintezës së zërit dhe përpunimit të informacionit në gjuhën natyrale. NeMo përfshin modele të trajnuara gati për sistemet e mësimit të makinerisë mbi bazën e framework-ut PyTorch, të zhvilluara nga NVIDIA duke përdorur të dhënat e zërit Common Voice dhe që mbulojnë gjuhë, theksime dhe forma të ndryshme të zërit. Modelet mund të jenë të dobishme për studiuesit që merren me krijimin e sistemeve të dialogut me zë, platformave për transkriptim dhe qendrave automatizuar të thirrjeve. Për shembull, NVIDIA NeMo përdoret në shërbimet automatike të zërit të MTS dhe Sberbank. Kodi NeMo është i shkruar në gjuhën Python duke përdorur PyTorch dhe shpërndahet nën licencën Apache 2.0.

Burimi: opennet.ru

Blini hosting tĂ« besueshĂ«m pĂ«r faqe interneti me mbrojtje nga DDoS, serverĂ« VPS VDS đŸ”„ Blini hosting tĂ« besueshĂ«m pĂ«r faqe interneti me mbrojtje nga DDoS, serverĂ« VPS VDS | ProHoster