Lansarea sintetizatorului de vorbire RHVoice 1.8.0

A avut loc lansarea versiunii deschise a sistemului de sinteză vocală RHVoice 1.8.0, inițial dezvoltat pentru a oferi suport de calitate pentru limba rusă, dar apoi adaptat și pentru alte limbi, inclusiv engleză, portugheză, ucraineană, kîrgîză, tătară și georgiană. Codul este scris în C++ și este distribuit sub licența LGPL 2.1. Este compatibil cu GNU/Linux, Windows și Android. Programul este compatibil cu interfețele TTS standard (text-to-speech) pentru conversia textului în vorbire: SAPI5 (Windows), Speech Dispatcher (GNU/Linux) și Android Text-To-Speech API, dar poate fi utilizat și în cititorul de ecran NVDA. Creatorul și principalul dezvoltator al RHVoice este Olga Yakovleva, care continuă să dezvolte proiectul în ciuda orbirii complete.

În versiunea 1.8 pentru platforma Android a fost introdus un nou sistem de gestionare a datelor vocale și lingvistice, permițând actualizarea datelor vocale fără a actualiza aplicația mobilă. Verificarea apariției actualizărilor de date pentru vocile și limbile adăugate se face automat. De asemenea, în noua versiune a fost implementat suportul pentru limba poloneză și a fost adăugat o nouă voce pentru limba macedoneană. S-a asigurat compatibilitatea cu versiunile alpha și beta recente ale cititorului de ecran NVDA. Problemele de compilare pe platforma Linux, apărute în absența Speech Dispatcher, au fost rezolvate.

Reamintim că în RHVoice sunt aplicate lucrările proiectului HTS (HMM/DNN-based Speech Synthesis System) și metoda parametrică de sinteză cu modele statistice (Statistical Parametric Synthesis pe baza HMM — Hidden Markov Model). Un avantaj al modelului statistic este overhead-ul scăzut și neexigența față de puterea CPU. Toate operațiile se desfășoară local pe sistemul utilizatorului. Sunt suportate trei niveluri de calitate a vocii (cu cât calitatea este mai scăzută — cu atât mai mare este performanța și mai scurt este timpul de reacție).

Dezavantajul modelului statistic este calitatea relativ scăzută a pronunției, care nu atinge nivelul sinteticelor care generează vorbire pe baza combinației de fragmente de vorbire naturală, dar totuși rezultatul este destul de inteligibil și amintește de transcrierea unei înregistrări cu un megafon. Spre comparație, proiectul Silero, care oferă un motor deschis pentru sinteză vocală bazat pe tehnologii de învățare automată și un set de modele pentru limba rusă, depășește RHVoice în ceea ce privește calitatea.

Pentru limba rusă sunt disponibile 14 variante de voci, iar pentru cea engleză — 6. Vocii sunt generate pe baza înregistrărilor de vorbire naturală. În setări, se poate modifica viteza, înălțimea și volumul. Pentru schimbarea tempo-ului poate fi utilizată biblioteca Sonic. Este posibilă identificarea și comutarea automată a limbii pe baza analizei textului de intrare (de exemplu, pentru cuvinte și citate în altă limbă poate fi utilizat modelul nativ de sinteză pentru acea limbă). Sunt acceptate profiluri vocale care definesc combinațiile de voci pentru diferite limbi.

Sursa: opennet.ro

Cumpără un hosting fiabil pentru site-uri cu protecție DDoS, servere VPS VDS 🔥 Cumpără un hosting fiabil pentru site-uri cu protecție DDoS, servere VPS VDS | ProHoster