Projekti ChatTTS publikoi një model dhe instrumente të lidhura për mësimin e automatizuar për sintezën e zërit emocional. Projekti ChatTTS është optimizuar posaçërisht për t'u përdorur në sistemet e dialogut, si ndihmësit interaktivë, dhe ka si qëllim riprodhimin e karakteristikave të komunikimit emocional natyror. Mbështetet ndërveprimi me disa folës dhe ndërtimi i një dialogu interaktiv. Elementet prosodike si qeshjet, ndalesat dhe ndërhyrjet ruhen dhe riprodhohen saktë gjatë sintezës.
GjatĂ« trajnimit tĂ« modelit janĂ« pĂ«rdorur rreth 40,000 orĂ« regjistrimesh zĂ«ri (nĂ« versionin jo publik tĂ« modelit â 100,000 orĂ«). Sipas zhvilluesve, pĂ«r nga mundĂ«sitĂ« e formimit tĂ« intonacioneve, modeli tejkalon tĂ« gjitha modelet e hapura tĂ« sintezĂ«s sĂ« zĂ«rit qĂ« ishin tĂ« disponueshme mĂ« parĂ«. Aktualisht, pĂ«r tĂ« menaxhuar emocionet gjatĂ« sintezĂ«s, mbĂ«shtetet vetĂ«m vendosja e tokeneve, pĂ«r shembull, '[laugh]' pĂ«r qeshjen. PĂ«r tĂ« gjeneruar njĂ« regjistrim 30-sekondĂ«sh kĂ«rkohet njĂ« GPU me 4 GB memorie. NĂ« GPU NVIDIA GeForce RTX 4090D, shpejtĂ«sia e gjenerimit Ă«shtĂ« pĂ«rafĂ«rsisht 7 tokene semantike nĂ« sekondĂ«. MbĂ«shtetet sinteza me zĂ« femĂ«ror dhe mashkullor nĂ« anglisht dhe nĂ« mandarin (pĂ«r gjuhĂ«n ruse rekomandohet framework-u TTS dhe modeli XTTS-v2, i cili pĂ«rveç sintezĂ«s mbĂ«shtet klonimin e zĂ«rit bazuar nĂ« njĂ« regjistrim tĂ« shkurtĂ«r zĂ«ri, pĂ«rfshirĂ« pĂ«r sintezĂ«n nĂ« njĂ« gjuhĂ« tjetĂ«r).
Modeli ChatTTS është publikuar nën licencën CC BY-NC-ND 4.0 (Creative Commons Attribution-NonCommercial-NoDerivatives 4.0), e cila lejon shpërndarjen e lirë me caktimin e autorit, por ndalon krijimin e veprave të derivaura dhe përdorimin në projekte komerciale. Përveç kësaj, për të parandaluar përdorimin e modelit për veprime të mashtrimit dhe krimit, gjatë trajnimit të modelit është përdorur vendosja e zhurmës me frekuencë të lartë dhe është angazhuar niveli maksimal i kompresimit të zërit, duke përdorur formatin MP3.
Burimi: opennet.ru
