A fost lansat modelul AI de sinteză vocală Zonos, care suportă clonarea vocii

Compania Zyphra a publicat sub licența Apache 2.0 prima versiune beta a modelului AI pentru sinteza vocală Zonos. Instrumentele oferite împreună cu modelul suportă funcția de clonare a vocii, permițând sinteza vocii dorite, pentru a reproduce careia modelul îi este suficient să ofere o înregistrare de referință de 30 de secunde a vorbitorului. Sinteza este suportată în engleză, japoneză, chineză, franceză și germană.

Modelul acoperă 1.6 miliarde de parametri și este antrenat pe 200.000 de ore de înregistrări audio. Sinteza este suportată atât pentru voce monotonă (așa cum se aude în cărțile audio), cât și pentru voce emoțională (așa cum ar suna într-o conversație vie), precum și sinteza pe baza unui prefix dat (se furnizează o înregistrare audio cu începutul vorbirii, pe baza căreia modelul sintetizează continuarea conform textului specificat, reproducând caracteristicile originale ale vocii, de exemplu, continuând să vorbească în șoaptă).

La ieșire se generează un sunet cu o frecvență de eșantionare de 44kHz. Este suportată inserția sintetizată a fragmentelor pentru a simula prezentări cu mai mulți vorbitori sau construirea de dialoguri interactive, precum și adăugarea de etichete pentru a controla viteza vorbirii, tonalitatea și expresia emoțiilor, cum ar fi bucuria, frica, tristețea și furia.

Potrivit dezvoltatorilor, calitatea vocii generate de model este comparabilă sau superioară tuturor sistemelor publice de sinteză deschise și comerciale disponibile (în teste se compară cu ElevenLabs, Cartesia și FishSpeech). Printre dezavantaje se menționează o concentrație mai mare de artefacte sonore, cum ar fi tusea, sunetul respirației sau scârțâitul, la începutul sau la sfârșitul materialului audio generat.

  • Zonos:
  • ElevenLabs:
  • Cartesia:
  • Fish Speech v1.5:

Pentru utilizarea modelului pe sistemul dvs., a fost pregătit o imagine gata de lucru pentru sistemul Docker, care include o interfață web pentru gestionarea sintezei, bazată pe platforma Gradio. Pentru a începe utilizarea, este suficient să instalați imaginea cu comanda „git clone https://github.com/Zyphra/Zonos.git; cd Zonos; docker compose up” și să deschideți în browser pagina „http://localhost:7860”. Se recomandă utilizarea unui GPU NVIDIA de cel puțin seria 3000 cu 6 GB memorie video. Performanța pe un sistem cu GPU RTX 4090 depășește de două ori cerințele necesare pentru sinteza în timp real.

A fost lansat modelul AI de sinteză vocală Zonos, care suportă clonarea vocii


Sursa: opennet.ro
Cumpără un hosting fiabil pentru site-uri cu protecție DDoS, servere VPS VDS 🔥 Cumpără un hosting fiabil pentru site-uri cu protecție DDoS, servere VPS VDS | ProHoster