Il progetto ChatTTS ha pubblicato un modello e un set di strumenti di apprendimento automatico per la sintesi della parlata emozionale. Il progetto ChatTTS è stato ottimizzato specificamente per l'uso in sistemi di dialogo, come assistenti interattivi, ed è mirato a riprodurre le caratteristiche della comunicazione emotiva naturale. Viene supportato l'interazione con più relatori e la costruzione di dialoghi interattivi. Gli elementi prosodici, come risate, pause e interiezioni, vengono monitorati e riprodotti correttamente durante la sintesi.
Per l'addestramento del modello sono state utilizzate circa 40.000 ore di registrazioni vocali (nel modello non pubblico, 100.000 ore). Secondo gli sviluppatori, il modello supera tutte le precedenti modelli di sintesi vocale open source per quanto riguarda la creazione di intonazioni. Attualmente, per controllare le emozioni durante la sintesi è supportata solo la sostituzione di token, ad esempio "[laugh]" per le risate. Per generare una registrazione di 30 secondi è necessaria una GPU con 4 GB di memoria. Su una GPU NVIDIA GeForce RTX 4090D, la velocità di generazione è di circa 7 token semantici al secondo. È supportata la sintesi con voce maschile e femminile in inglese e cinese (per la lingua russa, si può raccomandare il framework TTS e il modello XTTS-v2, che oltre alla sintesi supportano il cloning della voce da una breve registrazione vocale, incluso per la sintesi in un'altra lingua).
Il modello ChatTTS è pubblicato sotto licenza CC BY-NC-ND 4.0 (Creative Commons Attribution-NonCommercial-NoDerivatives 4.0), che consente la diffusione libera con attribuzione all'autore, ma vieta la creazione di opere derivate e l'uso in progetti commerciali. Inoltre, per prevenire l'uso del modello in attività fraudolente e criminali, durante l'addestramento è stata utilizzata l'inserzione di rumore ad alta frequenza e è stato attivato il massimo livello di compressione audio, utilizzando il formato MP3.
Fonte: opennet.ru
