Das AI-Modell zur Sprachsynthese Zonos unterstützt jetzt die Klonung von Stimmen.

Das Unternehmen Zyphra hat die erste Beta-Version des AI-Modells zur Sprachsynthese Zonos unter der Apache 2.0-Lizenz veröffentlicht. Zusammen mit dem Modell wird ein Toolkit angeboten, das die Sprachklon-Funktion unterstützt, mit der Sprache in der gewünschten Stimme synthetisiert werden kann. Dafür reicht es aus, dem Modell eine 30-sekündige Referenzaufnahme der Sprache des Sprechers zur Verfügung zu stellen. Die Synthese wird in Englisch, Japanisch, Chinesisch, Französisch und Deutsch unterstützt.

Das Modell umfasst 1,6 Milliarden Parameter und wurde mit 200.000 Stunden Audioaufnahmen trainiert. Es unterstützt die Synthese von monotoner (wie in Hörbüchern) und emotionaler Sprache (wie in lebhaften Gesprächen) sowie die Synthese basierend auf einem vorgegebenen Präfix (es wird eine Aufnahme mit dem Beginn der Sprache bereitgestellt, anhand derer das Modell den fortlaufenden Text synthetisiert und die ursprünglichen Sprechermerkmale, wie z. B. Flüstern, beibehält).

Es wird ein Ton mit einer Abtastrate von 44 kHz erzeugt. Es wird unterstützt, synthetisierte Inserts zu ersetzen, um Auftritte mit mehreren Sprechern zu simulieren oder interaktive Dialoge zu erstellen, sowie das Hinzufügen von Labels zur Steuerung der Sprechgeschwindigkeit, Tonalität und Ausdruck von Emotionen wie Freude, Angst, Traurigkeit und Wut.

Laut den Entwicklern steht die Qualität der erzeugten Sprache der aller öffentlichen, verfügbaren offenen und kommerziellen Synthesizer-Systeme in nichts nach oder übertrifft sie (in Tests wird ein Vergleich mit ElevenLabs, Cartesia und FishSpeech angestellt). Zu den Nachteilen gehört eine höhere Konzentration an Klangartefakten wie Husten, Atemgeräuschen oder Knarren zu Beginn oder am Ende des erzeugten Klangmaterials.

  • Zonos:
  • ElevenLabs:
  • Cartesia:
  • Fish Speech v1.5:

Um das Modell auf Ihrem System zu verwenden, steht ein betriebsbereites Abbild für Docker zur Verfügung, das eine Weboberfläche zur Verwaltung der Synthese auf Basis der Gradio-Plattform enthält. Für den Einstieg reicht es aus, das Abbild mit dem Befehl „git clone https://github.com/Zyphra/Zonos.git; cd Zonos; docker compose up“ zu installieren und die Seite „http://localhost:7860“ im Browser zu öffnen. Es wird empfohlen, über eine NVIDIA GPU der Serie 3000 mit mindestens 6 GB Videospeicher zu verfügen. Die Leistung auf einem System mit einer RTX 4090 GPU übersteigt die Anforderungen an die Echtzeitsynthese um das Doppelte.

Das AI-Modell zur Sprachsynthese Zonos unterstützt jetzt die Klonung von Stimmen.


Quelle: opennet.ru
Zuverlässiges Webhosting mit DDoS-Schutz, VPS- und VDS-Server kaufen 🔥 Zuverlässiges Webhosting mit DDoS-Schutz, VPS- und VDS-Server kaufen | ProHoster