Versioni e reja e sistemit të sintezës së zërit Silero

Një version i ri publik i sistemit të sintezës së zërit Silero Text-to-Speech është në dispozicion. Projekti është fokusuar kryesisht në krijimin e një sistemi modern dhe me cilësi të lartë të sintezës së zërit, që nuk është më i dobët se zgjidhjet komerciale nga korporatat dhe e aksesueshme për të gjithë ata që duan, pa pasur nevojë për pajisje serveri të shtrenjta.

Modelet shpërndahen nën licencën GNU AGPL, por kompania që zhvillon projektin nuk zbulohet mekanizmi i trajnimit të modeleve. Për t'u ekzekutuar, mund të përdoret PyTorch dhe framework-e që mbështesin formatin ONNX. Sinteza e zërit në Silero është e bazuar në përdorimin e algorithemeve dhe metodave të procesimit të sinjalit, të modifikuara në thellësi dhe moderne të rrjeteve neurale.

Kjo është e vërejtur se problemi kryesor i zgjidhjeve moderne të rrjeteve neurale për sintezën e zërit është se shpesh ato nuk janë të aksesueshme përveçse në kuadrin e zgjidhjeve të paguara në cloud, ndonëse produktet publike kanë kërkesa të larta për pajisje, cilësi më të ulët ose nuk janë produkte të përfunduara dhe gati për përdorim. Për shembull, për të ekzekutuar pa probleme një nga arkitekturat e reja të njohura të sintezës end-to-end, VITS, në modin e sintezës (domethënë, jo për trajnim modelesh), kërkohen karta grafike me më shumë se 16 gigabajt VRAM.

Megjithëse ka përshtypjen se është e komplikuar, zgjidhja Silero funksionon me sukses edhe në një nyje të procesorit x86 Intel me instruktionet AVX2. Në 4 nyje të procesorit, sinteza lejon të sintesohet midis 30 dhe 60 sekondash në sekondë në modin e sintezës 8 kHz, në modin 24 kHz – 15-20 sekonda, ndërsa në modin 48 kHz – rreth 10 sekonda.

Karakteristikat kryesore të versionit të ri të Silero:

  • Madhësia e modelit është reduktuar në 2 herë deri në 50 megabajt;
  • Modelet dinë të bëjnë pauza;
  • Janë në dispozicion 4 zëra të cilësisë së lartë në gjuhën ruse (dhe një numër të pafund të rasteve). Shembuj të shqiptimeve;
  • Modelet tani janë 10 herë më të shpejta dhe, për shembull, në modin 24 kHz lejojnë të sintesohet deri në 20 sekonda audio në sekondë në 4 nyje të procesorit;
  • Të gjitha variantet e zërit për një gjuhë janë të paketuar në një model;
  • Modelet mund të pranojnë paragrafë të tërë si hyrje, përkrahjnë etiketat SSML;
  • Sinteza funksionon menjëherë në tri frekuenca përzgjedhjeje – 8, 24 dhe 48 kilohertz;
  • Janë zgjidhur "problemet e vogla": paqëndrueshmëria dhe mungesa e fjalëve;
  • Janë shtuar flamuj për të kontrolluar vendosjen automatike të akcentëve dhe vendosjen e shkronjës «ё».

Aktualisht, për versionin më të fundit të sintezës janë të disponueshme publikisht 4 zëra në gjuhën ruse, por në të ardhmen e afërt do të publikohet versioni tjetër me këto ndryshime:

  • Shpejtësia e sintezës do të rritet edhe me 2-4 herë;
  • Do të përmirësohen modelet e sintezës për gjuhët e vendeve të CIS: Kalmyk, Tatar, Uzbek dhe Ukrainase;
  • Do të shtohen modelet për gjuhët evropiane;
  • Do të shtohen modelet për gjuhët indiane;
  • Do të shtohen modelet për gjuhën angleze.

Disa nga problemet sistematike, të pranishme në sintezën Silero:

  • Ndryshe nga zgjidhjet më tradicionale për sintezë, si RHVoice, sinteza Silero nuk ka integrim me SAPI, klientë të lehtë për t'u instaluar dhe integrime për Windows dhe Android;
  • Shpejtësia, megjithëse është jashtëzakonisht e lartë për një zgjidhje të tillë, mund të jetë e pamjaftueshme për sintezën në kohë reale në procesorë të dobët me cilësi të lartë;
  • Zgjidhja për vendosjen automatike të akcentëve nuk trajton omografe (fjalë si zAmok dhe zamOk) dhe prapë bën gabime, por kjo papërfundimësi do të korrigjohet në rishikimet e ardhshme;
  • Versioni aktual i sintezës nuk funksionon në procesorët pa udhëzime AVX2 (ose nevojitet të ndryshoni veçmas cilësimet e PyTorch), pasi një nga modulet brenda modelit është kquantizuar;
  • Versioni aktual i sintezës në thelb ka si varësi të vetme PyTorch, i gjithë materiali "është integruar" brenda modelit dhe paketave JIT. Burimet e modeleve nuk publikohen, ashtu si kodin për të ekzekutuar modelet nga klientët e PyTorch për gjuhë të tjera;
  • Libtorch, i disponueshëm për platforma mobile, është shumë më i rëndë se ONNX runtime, por versioni ONNX i modelit ende nuk ofrohet.

Burimi: opennet.ru

Blini hostim të besueshëm për faqe interneti me mbrojtje DDoS, serverë VPS VDS 🔥 Blini hostim të besueshëm për faqe interneti me mbrojtje DDoS, serverë VPS VDS - ProHoster