Das ChatTTS-Projekt hat ein Modell und die zugehörigen Werkzeuge für maschinelles Lernen zur Synthese emotionaler Sprache veröffentlicht. Das ChatTTS-Projekt ist speziell für die Verwendung in Dialogsystemen, wie interaktiven Assistenten, optimiert und hat das Ziel, die Eigenschaften der natürlichen emotionalen Kommunikation nachzubilden. Es wird die Interaktion mit mehreren Sprechern und der Aufbau interaktiver Dialoge unterstützt. Prosodische Elemente wie Lachen, Pausen und Füllwörter werden beim Synthetisieren korrekt erfasst und reproduziert.
Für das Training des Modells wurden etwa 40.000 Stunden Sprachaufzeichnungen verwendet (in der nicht öffentlichen Variante des Modells – 100.000 Stunden). Laut den Entwicklern übertrifft das Modell in seinen Fähigkeit zur Intonationsbildung all previously available open models for speech synthesis. Currently, the emotion control during synthesis only supports token substitution, such as '[laugh]' for laughter. To generate a 30-second recording, a GPU with 4 GB of memory is required. On the NVIDIA GeForce RTX 4090, the generation speed is approximately 7 semantic tokens per second. The synthesis supports both female and male voices in English and Chinese (for the Russian language, the TTS framework and the XTTS-v2 model are recommended, which besides synthesis also support voice cloning based on short speech recordings, including for synthesis in another language).
Das ChatTTS-Modell wurde unter der Lizenz CC BY-NC-ND 4.0 (Creative Commons Attribution-NonCommercial-NoDerivatives 4.0) veröffentlicht, die eine freie Verbreitung bei Angabe des Autors erlaubt, jedoch die Erstellung abgeleiteter Werke und die Nutzung in kommerziellen Projekten verbietet. Darüber hinaus wurden zur Verhinderung der Nutzung des Modells für betrügerische und kriminelle Handlungen beim Training des Modells hochfrequenter Rauschen substituiert und die maximale Audiodatenkompression unter Verwendung des MP3-Formats aktiviert.
Quelle: opennet.ru
