Noua versiune a sistemului de sinteză vocală Silero

A apărut o nouă versiune publică a sistemului de sinteză vocală pe bază de rețele neuronale Silero Text-to-Speech. Proiectul este destinat în principal creării unei sisteme moderne de sinteză vocală de înaltă calitate, comparabilă cu soluțiile comerciale ale corporațiilor și accesibilă pentru toți doritorii fără a necesita echipamente server costisitoare.

Modelele sunt distribuite sub licența GNU AGPL, dar compania care dezvoltă proiectul nu dezvăluie mecanismul de antrenare a modelului. Pentru a rula, se poate folosi PyTorch și cadre cu suport pentru formatul ONNX. Sinteza vocală în Silero se bazează pe utilizarea algoritmilor modernizați avansați de rețele neuronale și metode de procesare digitală a semnalelor.

Se remarcă faptul că principala problemă a soluțiilor moderne pe bază de rețele neuronale pentru sinteză vocală este că, de multe ori, ele sunt disponibile doar în cadrul soluțiilor cloud plătite, iar produsele publice au cerințe ridicate de hardware, o calitate mai slabă sau nu sunt soluții complete, gata de utilizare. De exemplu, pentru a rula fără probleme una dintre noile arhitecturi populare end-to-end pentru sinteză, VITS, în modul de sinteză (adică nu pentru antrenarea modelelor), sunt necesare plăci grafice cu mai mult de 16 gigaocteți de VRAM.

Contrar trendului stabilit, soluțiile Silero funcționează cu succes chiar și pe un singur fir de procesor Intel x86 cu instrucțiuni AVX2. Pe 4 fire de procesor, sinteza permite generarea a 30 până la 60 de secunde pe secundă în modul de sinteză 8 kHz, în modul 24 kHz — 15-20 sec., iar în modul 48 kHz — aproximativ 10 sec.

Principalele caracteristici ale noului release Silero:

  • Dimensiunea modelului a fost redusă de 2 ori la 50 de megabytes;
  • Modelele pot face pauze;
  • Sunt disponibile 4 voci de înaltă calitate în limba rusă (și un număr infinit de alegeri aleatorii). Exemple de pronunție;
  • Modelele au devenit de 10 ori mai rapide și, de exemplu, în modul 24 kHz permit generarea a până la 20 de secunde de audio pe secundă pe 4 fire de procesor;
  • Toate variantele de voci pentru o limbă sunt ambalate într-un singur model;
  • Modelele pot accepta paragrafe întregi de text ca intrare, sunt suportate etichetele SSML;
  • Sinteza funcționează simultan în trei frecvențe de eșantionare la alegere — 8, 24 și 48 kHz;
  • Au fost rezolvate «problemele de copilărie»: instabilitatea și omisiunea cuvintelor;
  • Au fost adăugate steaguri pentru controlul plasării automate a accentelor și a literei «ё».

Acum, pentru cea mai nouă versiune a sintetizatorului, sunt disponibile public 4 voci în limba rusă, dar în curând va fi publicată următoarea versiune cu următoarele modificări:

  • Viteza de sintetizare va crește cu 2-4 ori;
  • Modelele de sintetizare pentru limbile din CSI vor fi actualizate: Kalmyk, Tătar, Uzbec și Ucrainean;
  • Vor fi adăugate modele pentru limbile europene;
  • Vor fi adăugate modele pentru limbile indiene;
  • Vor fi adăugate modele pentru limba engleză.

Iată câteva din problemele sistemice caracteristice sintetizatorului Silero:

  • Spre deosebire de soluțiile mai tradiționale pentru sintetizare, precum RHVoice, sintetizatorul Silero nu are integrare cu SAPI, clienți ușor de instalat și integrarea pentru Windows și Android;
  • Viteza, deși fără precedent de mare pentru o astfel de soluție, poate fi insuficientă pentru sintetizarea în timp real pe procesoare slabe în calitate înaltă;
  • Soluția pentru plasarea automată a accentelor nu tratează omografele (cuvinte precum zАмок și замОк) și încă mai face greșeli, dar această neglijență va fi corectată în viitoarele versiuni;
  • Versiunea curentă a sintetizatorului nu funcționează pe procesoare fără instrucțiuni AVX2 (sau trebuie să modificați special setările PyTorch), deoarece unul dintre modulele din interiorul modelului este cuantizat;
  • Versiunea curentă a sintetizatorului are ca singură dependență PyTorch, toate componentele sunt integrate în model și JIT-packages. Sursele modelului nu sunt publicate, la fel ca și codul pentru rularea modelelor de către clienți PyTorch pentru alte limbi;
  • Libtorch, disponibil pentru platforme mobile, este mult mai voluminos decât ONNX runtime, dar versiunea modelului ONNX nu este încă disponibilă.

Sursa: opennet.ro

Cumpără un hosting fiabil pentru site-uri cu protecție DDoS, servere VPS VDS 🔥 Cumpără un hosting fiabil pentru site-uri cu protecție DDoS, servere VPS VDS | ProHoster