Pubblicato il modello AI di sintesi vocale Zonos, supporta il cloning della voce

L'azienda Zyphra ha pubblicato sotto licenza Apache 2.0 la prima versione beta del modello AI per la sintesi vocale Zonos. L'insieme di strumenti fornito con il modello supporta la funzione di clonazione vocale, consentendo di sintetizzare il discorso con la voce desiderata; per riprodurre questa voce, è sufficiente fornire un campione di 30 secondi della registrazione del parlatore. È supportata la sintesi in inglese, giapponese, cinese, francese e tedesco.

Il modello comprende 1,6 miliardi di parametri ed è stato addestrato su 200.000 ore di registrazioni audio. È supportata la sintesi di discorsi monotoni (come negli audiolibri) e discorsi emozionali (come nelle conversazioni dal vivo), così come la sintesi basata su un prefisso specificato (una registrazione audio con l'inizio del discorso, sulla quale il modello sintetizza il proseguimento in base al testo fornito, mantenendo le caratteristiche originali del parlato, ad esempio continuando a parlare a bassa voce).

In uscita viene generato un suono con una frequenza di campionamento di 44 kHz. È supportata la sostituzione di inserti sintetizzati per simulare presentazioni con più relatori o per costruire dialoghi interattivi, così come l'aggiunta di etichette per controllare la velocità del discorso, l'intonazione e l'espressione delle emozioni, come gioia, paura, tristezza e rabbia.

Secondo i dichiaranti, la qualità del discorso generato dal modello è pari o superiore a tutti i sistemi di sintesi pubblicamente disponibili, sia aperti che commerciali (nei test viene effettuato un confronto con ElevenLabs, Cartesia e FishSpeech). Tra gli svantaggi si nota una maggiore concentrazione di artefatti sonori, come tosse, suono della respirazione o scricchiolii, all'inizio o alla fine del materiale sonoro generato.

  • Zonos:
  • ElevenLabs:
  • Cartesia:
  • Fish Speech v1.5:

Per utilizzare il modello sul proprio sistema è stato preparato un'immagine pronta per l'uso per il sistema Docker, che include un'interfaccia web per gestire la sintesi, basata sulla piattaforma Gradio. Per iniziare a lavorare, basta installare l'immagine con il comando «git clone https://github.com/Zyphra/Zonos.git; cd Zonos; docker compose up» e aprire la pagina «http://localhost:7860» nel browser. Si raccomanda di avere una GPU NVIDIA di almeno serie 3000 con 6 GB di memoria video. Le prestazioni del lavoro su un sistema con GPU RTX 4090 superano di due volte le capacità necessarie per la sintesi in tempo reale.

Pubblicato il modello AI di sintesi vocale Zonos, supporta il cloning della voce


Fonte: opennet.ru
Acquista hosting affidabile per siti web con protezione DDoS, VPS VDS server 🔥 Acquista hosting affidabile per siti web con protezione DDoS, VPS VDS server | ProHoster