Pubblicazione del sintetizzatore vocale RHVoice 1.6.0

È stato rilasciato il sistema di sintesi vocale open source RHVoice 1.6.0, originariamente sviluppato per garantire un supporto di qualità per la lingua russa, ma successivamente adattato anche per altre lingue, tra cui inglese, portoghese, ucraino, kirghizo, tataro e georgiano. Il codice è scritto in C++ e distribuito sotto licenza LGPL 2.1. È supportato su GNU/Linux, Windows e Android. Il programma è compatibile con le interfacce TTS (sintesi vocale) standard per la conversione di testo in voce: SAPI5 (Windows), Speech Dispatcher (GNU/Linux) e Android Text-To-Speech API, ma può anche essere utilizzato nel lettore di schermo NVDA. L'autrice e principale sviluppatrice di RHVoice è Olga Yakovleva, che porta avanti il progetto nonostante la cecità totale.

La nuova versione include 5 nuove varianti di voce per la lingua russa. È stata implementata la supporto per la lingua albanese. Il dizionario per la lingua ucraina è stato aggiornato. È stata ampliata la supporto per la lettura dei simboli emoji. È stato lavorato per correggere errori nell'applicazione per la piattaforma Android, semplificata l'importazione dei dizionari personalizzati, aggiunta la compatibilità con Android 11. Sono state aggiunte nuove impostazioni e funzionalità al nucleo del motore, tra cui g2p.case, word_break e supporto per filtri di equalizzazione.

Ricordiamo che in RHVoice vengono applicati i contributi del progetto HTS (HMM/DNN-based Speech Synthesis System) e il metodo parametrico di sintesi con modelli statistici (Statistical Parametric Synthesis basato su HMM - Hidden Markov Model). Un vantaggio del modello statistico è il basso sovraccarico e il suo ridotto fabbisogno di potenza della CPU. Tutte le operazioni vengono eseguite localmente sul sistema dell'utente. Sono supportati tre livelli di qualità vocale (maggiore è la qualità, minore è la prestazione e più lungo è il tempo di risposta).

Un svantaggio del modello statistico è la qualità di pronuncia relativamente bassa, che non raggiunge il livello dei sintetizzatori che generano voce sulla base di combinazioni di frammenti di voce naturale; tuttavia, il risultato è comunque abbastanza comprensibile e ricorda la trasmissione di una registrazione tramite un altoparlante. A titolo di confronto, il progetto Silero, che offre un motore open source per la sintesi vocale basato su tecnologie di apprendimento automatico e un set di modelli per la lingua russa, supera RHVoice in termini di qualità.

Per la lingua russa sono disponibili 13 varianti di voce, mentre per quella inglese ci sono 5. Le voci sono generate sulla base di registrazioni di parlato naturale. Nelle impostazioni è possibile modificare la velocità, l'intonazione e il volume. Per modificare il ritmo si può utilizzare la libreria Sonic. È possibile l'identificazione automatica e il cambio della lingua sulla base dell'analisi del testo in ingresso (ad esempio, per parole e citazioni in un'altra lingua può essere utilizzato il modello di sintesi nativo per quella lingua). Sono supportati profili vocali che definiscono combinazioni di voci per diverse lingue.

Fonte: opennet.ru

Acquista hosting affidabile per siti web con protezione DDoS, VPS VDS server 🔥 Acquista hosting affidabile per siti web con protezione DDoS, VPS VDS server | ProHoster