Projekti ChatTTS ka publikuar modelin dhe mjetet përkatëse të machine learning për sintezën e të folurit emocional. ChatTTS është optimizuar posaçërisht për përdorim në sisteme dialogu, si ndihmësit interaktivë, dhe synon të riprodhojë veçoritë e komunikimit natyror emocional. Mbështetet ndërveprimi me disa folës dhe ndërtimi i një dialogu interaktiv. Elementet prosodike si e qeshura, pauzat dhe pasthirrmat ndiqen dhe riprodhohen saktë gjatë sintezës.
GjatĂ« trajnimit tĂ« modelit janĂ« pĂ«rdorur rreth 40 mijĂ« orĂ« regjistrimesh zanore (nĂ« variantin jo publik tĂ« modelit â 100 mijĂ« orĂ«). Sipas zhvilluesve, pĂ«r nga aftĂ«sia pĂ«r tĂ« formuar intonacione, modeli tejkalon tĂ« gjitha modelet e hapura tĂ« sintezĂ«s sĂ« tĂ« folurit qĂ« kanĂ« qenĂ« tĂ« disponueshme mĂ« parĂ«. PĂ«r kontrollin e emocioneve gjatĂ« sintezĂ«s, aktualisht mbĂ«shtetet vetĂ«m futja e tokenĂ«ve, pĂ«r shembull, â[laugh]â pĂ«r tĂ« qeshurĂ«n. PĂ«r gjenerimin e njĂ« regjistrimi 30-sekondĂ«sh kĂ«rkohet njĂ« GPU me 4 GB memorie. NĂ« GPU NVIDIA GeForce RTX 4090D, shpejtĂ«sia e gjenerimit Ă«shtĂ« afĂ«rsisht 7 tokenĂ« semantikĂ« nĂ« sekondĂ«. MbĂ«shtetet sinteza me zĂ« femĂ«ror dhe mashkullor nĂ« gjuhĂ«n angleze dhe kineze (pĂ«r gjuhĂ«n ruse mund tĂ« rekomandohen framework-u TTS dhe modeli XTTS-v2, tĂ« cilĂ«t pĂ«rveç sintezĂ«s mbĂ«shtesin edhe klonimin e zĂ«rit nga njĂ« regjistrim i shkurtĂ«r i tĂ« folurit, pĂ«rfshirĂ« edhe sintezĂ«n nĂ« njĂ« gjuhĂ« tjetĂ«r).
Modeli ChatTTS është publikuar nën licencën CC BY-NC-ND 4.0 (Creative Commons Attribution-NonCommercial-NoDerivatives 4.0), e cila lejon shpërndarje të lirë me kusht që të citohet autori, por ndalon krijimin e veprave derivate dhe përdorimin në projekte komerciale. Për më tepër, për të mbrojtur modelin nga përdorimi në mashtrime dhe veprimtari kriminale, gjatë trajnimit janë përdorur injektimi i zhurmës me frekuencë të lartë dhe niveli maksimal i kompresimit të audios, duke përdorur formatin MP3.
Burimi: opennet.ru
