Het AI-model voor spraaksynthese Zonos is uitgebracht, dat stemkloning ondersteunt.

Zyphra heeft onder de Apache 2.0-licentie de eerste bèta-uitgave van het AI-model voor spraaksynthese Zonos gepubliceerd. De bij het model geleverde toolkit ondersteunt de functie voor stemkloning, waarmee spraak kan worden gesynthetiseerd met een gewenste stem. Voor de reproductie daarvan is het voldoende om een 30 seconden durende referentieopname van de spreker te verstrekken. Synthese in het Engels, Japans, Chinees, Frans en Duits wordt ondersteund.

Het model omvat 1,6 miljard parameters en is getraind op 200.000 uur audiomateriaal. Zowel monotone synthese (zoals in audioboeken) als emotionele spraak (zoals in een echt gesprek) worden ondersteund, evenals synthese op basis van een opgegeven voorvoegsel (er wordt een audiorecording gepresenteerd met het begin van de spraak, waarop het model de voortzetting synthetiseert op basis van de opgegeven tekst, waarbij de oorspronkelijke kenmerken van de spraak, zoals het fluisteren, worden voortgezet).

Aan de output wordt een geluid met een samplefrequentie van 44 kHz gegenereerd. Het is mogelijk om gesynthetiseerde inserts te vervangen om optredens met meerdere sprekers na te bootsen of interactieve dialogen op te bouwen, evenals het toevoegen van labels voor het controleren van de spreektempo, toonhoogte en emotionele expressie, zoals vreugde, angst, verdriet en woede.

Volgens de ontwikkelaars staat de kwaliteit van de gegenereerde spraak niet onderdanig aan of overtreft deze alle openbaar beschikbare open-source en commerciële synthesesystemen (de tests vergelijken met ElevenLabs, Cartesia en FishSpeech). Een van de nadelen is een hogere concentratie van geluidsartefacten, zoals hoesten, ademgeluiden of kraken, aan het begin of einde van het geproduceerde geluidmateriaal.

  • Zonos:
  • ElevenLabs:
  • Cartesia:
  • Fish Speech v1.5:

Voor het gebruik van het model op uw systeem is een kant-en-klare afbeelding voor het Docker-systeem voorbereid, inclusief een webinterface voor het beheren van de synthese, gebaseerd op het Gradio-platform. Om aan de slag te gaan, volstaat het om de afbeelding te installeren met het commando 'git clone https://github.com/Zyphra/Zonos.git; cd Zonos; docker compose up' en de webpagina 'http://localhost:7860' in uw browser te openen. Het wordt aanbevolen om minimaal een NVIDIA GPU van de 3000-serie met 6 GB videogeheugen te hebben. De prestaties op een systeem met een RTX 4090 GPU zijn twee keer zoveel als nodig voor synthese in real-time.

Het AI-model voor spraaksynthese Zonos is uitgebracht, dat stemkloning ondersteunt.


Bron: opennet.ru
Koop betrouwbare webhosting met bescherming tegen DDoS, VPS VDS servers 🔥 Koop betrouwbare webhosting met bescherming tegen DDoS, VPS VDS servers | ProHoster