L'entreprise Zyphra a publié sous licence Apache 2.0 la première version bêta de son modèle AI pour la synthèse vocale Zonos. L'outil proposé avec le modèle prend en charge la fonction de clonage vocal, permettant de synthétiser la parole dans la voix souhaitée ; pour cela, il suffit de fournir un enregistrement de 30 secondes de la voix de l'orateur. La synthèse est supportée en anglais, japonais, chinois, français et allemand.
Le modèle compte 1,6 milliard de paramètres et est entraîné sur 200 000 heures d'enregistrements audio. Il prend en charge la synthèse de la parole monotone (comme dans les livres audio) et de la parole émotionnelle (comme dans une conversation vivante), ainsi que la synthèse à partir d'un préfixe donné (on fournit un enregistrement audio du début de la parole, sur la base duquel le modèle synthétise la suite selon le texte indiqué, reproduisant les caractéristiques d'origine de la voix, par exemple, en continuant à parler à voix basse).
La sortie génère un son avec une fréquence d'échantillonnage de 44 kHz. Elle prend en charge l'insertion de segments à synthétiser pour simuler des performances avec plusieurs locuteurs ou construire des dialogues interactifs, ainsi que l'ajout d'étiquettes pour contrôler la vitesse de la parole, la tonalité et l'expression d'émotions telles que la joie, la peur, la tristesse et la colère.
Selon les développeurs, la qualité de la parole générée par le modèle est équivalente ou supérieure à celle de tous les systèmes de synthèse ouverts et commerciaux disponibles publiquement (des comparaisons avec ElevenLabs, Cartesia et FishSpeech sont fournies dans les tests). Parmi les inconvénients, on note une concentration plus élevée d'artefacts sonores, tels que la toux, le bruit de la respiration ou les grincements, au début ou à la fin du matériel sonore généré.
- Zonos :
- ElevenLabs :
- Cartesia :
- Fish Speech v1.5 :
- ElevenLabs :
Pour utiliser le modèle sur votre système, une image prête à l'emploi pour Docker a été préparée, comprenant une interface web pour gérer la synthèse, basée sur la plateforme Gradio. Pour commencer, il suffit d'installer l'image avec la commande « git clone https://github.com/Zyphra/Zonos.git; cd Zonos; docker compose up » et d'ouvrir dans le navigateur la page « http://localhost:7860 ». Il est recommandé d'avoir un GPU NVIDIA d'au moins la série 3000 avec 6 Go de mémoire vidéo. La performance sur un système avec un GPU RTX 4090 est deux fois supérieure aux capacités nécessaires pour la synthèse en temps réel.

Source : opennet.ru
