Përditësimi i të dhënave zanore Mozilla Common Voice 7.0

Kompania NVIDIA dhe Mozilla kanë prezantuar një përditësim të grupeve të të dhënave të zërit, të mbledhura nga iniciativa Common Voice dhe që përfshijnë shembuj të shqiptimit nga 182 mijë njerëz, që është 25% më shumë se 6 muaj më parë. Të dhënat janë publikuar si pronë publike (CC0). Grupet e propozuara mund të përdoren në sistemet e mësimit të makinerive për ndërtimin e modeleve të njohjes dhe sintetikës së zërit.

NĂ« krahasim me pĂ«rditĂ«simin e kaluar, volumi i materialit tĂ« zĂ«rit nĂ« koleksion Ă«shtĂ« rritur nga 9 nĂ« 13.9 mijĂ« orĂ« zĂ«ri. Numri i gjuhĂ«ve tĂ« mbĂ«shtetura Ă«shtĂ« rritur nga 60 nĂ« 76, duke pĂ«rfshirĂ« pĂ«r herĂ« tĂ« parĂ« mbĂ«shtetje pĂ«r gjuhĂ«t belaruse, kazake, uzbeqe, bullgare, armeniane, aziere dhe bashkurtse. Grupi pĂ«r gjuhĂ«n ruse pĂ«rfshin 2136 pjesĂ«marrĂ«s dhe 173 orĂ« material zĂ«ri (ishin 1412 pjesĂ«marrĂ«s dhe 111 orĂ«), ndĂ«rsa pĂ«r gjuhĂ«n ukrainase — 615 pjesĂ«marrĂ«s dhe 66 orĂ« (ishin 459 pjesĂ«marrĂ«s dhe 30 orĂ«).

NĂ« pĂ«rgatitjen e materialeve nĂ« anglisht kanĂ« marrĂ« pjesĂ« mĂ« shumĂ« se 75 mijĂ« njerĂ«z, qĂ« kanĂ« regjistruar 2637 orĂ« zĂ«ri tĂ« konfirmuar (ishin 66 mijĂ« pjesĂ«marrĂ«s dhe 1686 orĂ«). ËshtĂ« interesante se gjuha e dytĂ« pĂ«r nga volumi i tĂ« dhĂ«nave tĂ« grumbulluara Ă«shtĂ« ruanda, pĂ«r tĂ« cilĂ«n janĂ« mbledhur 2260 orĂ«. PasojnĂ« gjermanishtja (1040), katalanishtja (920) dhe esperanto (840). Nga gjuhĂ«t qĂ« po rritin ndjeshĂ«m volumin e tĂ« dhĂ«nave tĂ« zĂ«rit, pĂ«rmenden gjuha tajlandeze (rritja e bazĂ«s 20 herĂ«, nga 12 nĂ« 250 orĂ«), luganda (nga 8 nĂ« 80 orĂ«), esperanto (nga 100 nĂ« 840 orĂ«) dhe gjuha tamile (nga 24 nĂ« 220 orĂ«).

Si në kuadër të pjesëmarrjes së saj në projektin Common Voice, kompania NVIDIA ka përgatitur modele të trajnuara në bazë të të dhënave të mbledhura për sistemet e mësimit dixhital (mbështetet nga PyTorch). Modelet shpërndahen në kuadër të instrumenteve falas dhe të hapur NVIDIA NeMo, i cili, për shembull, tashmë përdoret në shërbimet e automatizuara të zërit të MTS dhe Sberbank. Modelet janë të orientuara për përdorim në sistemet e njohjes së zërit, të sintezës së zërit dhe përpunimit të informacionit në gjuhën natyrore, dhe mund të jenë të dobishme për hulumtuesit që punojnë në krijimin e sistemeve të dialogut me zë, platformave për transkriptim dhe qendrave të thirrjeve të automatizuara. Ndryshe nga projektet e tjera të disponueshme më parë, modelet e publikuara nuk kufizohen vetëm në njohjen e gjuhës angleze dhe mbulojnë gjithashtu gjuhë, aksente dhe forma të ndryshme të zërit.

Kujtojmë se projekti Common Voice ka si qëllim organizimin e një bashkëpunimi për grumbullimin e një baze të shablloneve të zërit, që merr në konsideratë të gjithë larmishmërinë e zërit dhe mënyrave të komunikimit. Përdoruesit ftohen të lexojnë frazat që shfaqen në ekran ose të vlerësojnë cilësinë e të dhënave, të shtuar nga përdorues të tjerë. Baza e dhënash e mbledhur me regjistrime të shqiptimit të fjalive tipike të zërit njerëzor mund të përdoret pa kufizime në sistemet e mësimit dixhital dhe në projektet hulumtuese.

Sipas autorit të bibliotekës për njohjen e zërit të integruar Vosk, disavantazhet e setit Common Voice janë njëanshmëria e materialit të zërit (dominojnë meshkujt e moshës 20-30 vjeçare dhe mungesa e materialeve me zëra femrash, fëmijësh dhe të moshuarish), mungesa e variacionit të fjalorit (përsëritja e të njëjtave fraza) dhe shpërndarja e regjistrimeve në formatin MP3 që shkakton deformime.

Burimi: opennet.ru

Blini hosting tĂ« besueshĂ«m pĂ«r faqe interneti me mbrojtje nga DDoS, serverĂ« VPS VDS đŸ”„ Blini hosting tĂ« besueshĂ«m pĂ«r faqe interneti me mbrojtje nga DDoS, serverĂ« VPS VDS | ProHoster