Kompani NVIDIA dhe Mozilla prezantuan përditësimin e grupeve të të dhënave vokale, të mbledhura si rezultat i iniciativës Common Voice dhe që përfshijnë shembuj të shqiptimit nga 182 mijë njerëz, që është 25% më shumë se 6 muaj më parë. Të dhënat janë publikuar si pronë publike (CC0). Grupet e propozuara mund të përdoren në sistemet e mësimit të makinave për ndërtimin e modeleve për njohjen dhe sintezën e foljes.
NĂ« krahasim me pĂ«rditĂ«simin e kaluar, pĂ«rmasat e materialit tĂ« folur nĂ« koleksion u rritĂ«n nga 9 nĂ« 13.9 mijĂ« orĂ« tĂ« folur. Numri i gjuhĂ«ve tĂ« mbĂ«shtetura u rrit nga 60 nĂ« 76, duke pĂ«rfshirĂ« pĂ«r herĂ« tĂ« parĂ« mbĂ«shtetje pĂ«r gjuhĂ«t Belorusisht, Kazakisht, Ujgurisht, Bullgarisht, Armenisht, Azerbaixhanisht, dhe Bashkirisht. Seti pĂ«r gjuhĂ«n Ruse mbulon 2136 pjesĂ«marrĂ«s dhe 173 orĂ« material tĂ« folur (ishin 1412 pjesĂ«marrĂ«s dhe 111 orĂ«), dhe pĂ«r gjuhĂ«n Ukrainase â 615 pjesĂ«marrĂ«s dhe 66 orĂ« (ishin 459 pjesĂ«marrĂ«s dhe 30 orĂ«).
NĂ« pĂ«rgatitjen e materialeve nĂ« anglisht morĂ«n pjesĂ« mĂ« shumĂ« se 75 mijĂ« njerĂ«z, duke regjistruar 2637 orĂ« tĂ« foljes sĂ« konfirmuar (ishe 66 mijĂ« pjesĂ«marrĂ«s dhe 1686 orĂ«). ĂshtĂ« interesante se gjuha e dytĂ« me mĂ« shumĂ« tĂ« dhĂ«na tĂ« akumuluara Ă«shtĂ« gjuha rwandese, pĂ«r tĂ« cilĂ«n janĂ« mbledhur 2260 orĂ«. Pas saj renditen gjermanishtja (1040), katalanasja (920) dhe esperanto (840). Nga gjuhĂ«t me rritje mĂ« dinamike tĂ« materialeve vokale pĂ«rmenden gjuha tailandeze (rritje baze 20 herĂ«, nga 12 nĂ« 250 orĂ«), luganda (nga 8 nĂ« 80 orĂ«), esperanto (nga 100 nĂ« 840 orĂ«) dhe gjuha tamile (nga 24 nĂ« 220 orĂ«).
Në kuadër të pjesëmarrjes së saj në projektin Common Voice, kompania NVIDIA ka përgatitur modele të trajnuara për sistemet e mësimit të makinave (përkrahëse PyTorch) bazuar në të dhënat e mbledhura. Modelet shpërndahen si pjesë e mjetit falas dhe të hapur NVIDIA NeMo, i cili, për shembull, tashmë përdoret në shërbimet automatizuese të zërit të MTS dhe Sberbank. Modelet janë të orientuara për përdorimin në sistemet e njohjes së foljes, sintezës së foljes dhe përpunimit të informacionit në gjuhë natyrore, dhe mund të jenë të dobishme për hulumtuesit që punojnë në krijimin e sistemeve të dialogut me zë, platformave për transkriptime dhe qendrave të thirrjeve automatizore. Ndryshe nga projektet e disponueshme më parë, modelet e publikuara nuk kufizohen në njohjen e gjuhës angleze dhe mbulojnë gjuhë, akcentet dhe forma të ndryshme të foljes.
Kujtojmë se projekti Common Voice ka si qëllim organizimin e një pune të përbashkët për mbledhjen e një baze të shablloneve të zërit, e cila merr parasysh gjithë diversitetin e zërave dhe stilit të foljes. Përdoruesve u ofrohet të lexojnë frazat që shfaqen në ekran ose të vlerësojnë cilësinë e të dhënave të shtuar nga përdorues të tjerë. Baza e akumuluar e të dhënave me regjistrime të shqiptimeve të frazave të zakonshme të foljes njerëzore mund të përdoret pa kufizime në sistemet e mësimit të makinave dhe në projektet hulumtuese.
Sipërmarrësi i bibliotekës për njohjen e foljes së përzier Vosk beson se disavantazhet e grupit Common Voice janë njëanshmëria e materialeve vokale (dominate e njerëzve të seksit meshkuj nga 20-30 vjeç, dhe mungesa e materialeve nga zërat e grave, fëmijëve dhe të moshuarve), mungesa e variacioneve në fjalor (ripërsëritja e frazave të njëjta) dhe shpërndarja e regjistrimeve në një format që shkakton dëmtime si MP3.
Burimi: opennet.ru
