Das AI-Modell zur Sprachsynthese Zonos, das die Stimmklonung unterstützt, wurde veröffentlicht.

Das Unternehmen Zyphra hat unter der Apache 2.0-Lizenz die erste Betaversion des AI-Modells zur Sprachsynthese Zonos veröffentlicht. Das mit dem Modell bereitgestellte Toolkit unterstützt die Funktion der Stimmklonierung, die es ermöglicht, Sprache mit einer gewünschten Stimme zu synthetisieren. Um die Stimme zu reproduzieren, reicht es aus, der Modell 30 Sekunden einer Referenzaufnahme des Sprechers bereitzustellen. Die Synthese wird in Englisch, Japanisch, Chinesisch, Französisch und Deutsch unterstützt.

Das Modell umfasst 1,6 Milliarden Parameter und wurde auf 200.000 Stunden Audiodaten trainiert. Es unterstützt die Synthese von monotoner Sprache (wie in Hörbüchern) und emotionaler Sprache (wie im Gespräch), sowie die Synthese basierend auf einem vorgegebenen Präfix (es wird eine Audioaufnahme mit dem Beginn der Rede bereitgestellt, auf deren Basis das Modell eine Fortsetzung des angegebenen Textes synthetisiert und die ursprünglichen Spracheigenschaften beibehält, beispielsweise weiterhin flüstert).

Die ausgegebene Klangqualität hat eine Abtastrate von 44 kHz. Es wird die Einfügung synthetisierter Einsätze zur Simulation von Aufführungen mit mehreren Sprechern oder zur Erstellung interaktiver Dialoge unterstützt, ebenso wie die Hinzufügung von Markierungen zur Steuerung der Sprechgeschwindigkeit, Tonhöhe und Ausdruck von Emotionen wie Freude, Angst, Traurigkeit und Wut.

Laut den Entwicklern steht die Qualität der generierten Sprache im Vergleich zu allen öffentlich verfügbaren offenen und kommerziellen Synthesesystemen nicht nach und übertrifft sie teilweise (in den Tests wird ein Vergleich mit ElevenLabs, Cartesia und FishSpeech angeführt). Zu den Nachteilen wird eine höhere Konzentration von Klangartefakten wie Husten, Atemgeräuschen oder Knarren zu Beginn oder am Ende des erzeugten Klangmaterials erwähnt.

  • Zonos:
  • ElevenLabs:
  • Cartesia:
  • Fish Speech v1.5:

Für die Nutzung des Modells auf Ihrem System wurde ein betriebsbereites Image für Docker vorbereitet, das ein Web-Interface zur Steuerung der Synthese enthält, das auf der Gradio-Plattform basiert. Für den Start reicht es aus, das Image mit dem Befehl „git clone https://github.com/Zyphra/Zonos.git; cd Zonos; docker compose up“ zu installieren und die Seite „http://localhost:7860“ im Browser zu öffnen. Für den Betrieb wird eine NVIDIA-GPU der Serie 3000 mit mindestens 6 GB Video-RAM empfohlen. Die Leistung auf einem System mit einer RTX 4090 GPU übertrifft die Anforderungen für die Echtzeitsynthese um das Doppelte.

Das AI-Modell zur Sprachsynthese Zonos, das die Stimmklonung unterstützt, wurde veröffentlicht.


Quelle: opennet.ru
60GB SSD 8Gb DDR4