Il progetto ChatTTS ha pubblicato un modello e relativi strumenti di machine learning per la sintesi di voce emozionale. ChatTTS è specificamente ottimizzato per l'uso in sistemi di dialogo, come assistenti interattivi, e mira a riprodurre le caratteristiche della comunicazione emotiva naturale. Supporta l'interazione con più parlanti e la costruzione di dialoghi interattivi. Gli elementi prosodici, come le risate, le pause e le interiezioni, vengono tracciati e riprodotti correttamente durante la sintesi.
Per l'addestramento del modello sono state utilizzate circa 40.000 ore di registrazioni vocali (nella versione non pubblica del modello, 100.000 ore). Secondo gli sviluppatori, in termini di capacità di intonazione, il modello supera tutte le precedenti soluzioni di sintesi vocale disponibili. Attualmente, per gestire le emozioni durante la sintesi, è supportata solo la sostituzione dei token, ad esempio, "[laugh]" per le risate. Per generare una registrazione di 30 secondi è necessaria una GPU con 4 GB di memoria. Su GPU NVIDIA GeForce RTX 4090D, la velocità di generazione è di circa 7 token semantici al secondo. È supportata la sintesi con voce maschile e femminile in inglese e cinese (per la lingua russa si consiglia il framework TTS e il modello XTTS-v2, che oltre alla sintesi supporta anche la clonazione della voce da una breve registrazione, anche per la sintesi in un'altra lingua).
Il modello ChatTTS è pubblicato sotto la licenza CC BY-NC-ND 4.0 (Creative Commons Attribution-NonCommercial-NoDerivatives 4.0), che consente la distribuzione libera con citazione dell'autore, ma vieta la creazione di opere derivate e l'uso in progetti commerciali. Inoltre, per prevenire l'uso del modello in attività fraudolente e criminali, durante l'addestramento del modello è stata utilizzata la sostituzione di rumore ad alta frequenza e sono stati impiegati il massimo livello di compressione audio utilizzando il formato MP3.
Fonte: opennet.ru
