È stata rilasciata la versione 1.8.0 del sistema di sintesi vocale open source RHVoice, originariamente sviluppato per fornire un supporto di qualità per la lingua russa, ma successivamente adattato anche per altre lingue, tra cui inglese, portoghese, ucraino, kirghiso, tataro e georgiano. Il codice è scritto in C++ e distribuito con licenza LGPL 2.1. È supportato su GNU/Linux, Windows e Android. Il programma è compatibile con le interfacce TTS standard (text-to-speech) per la conversione del testo in voce: SAPI5 (Windows), Speech Dispatcher (GNU/Linux) e Android Text-To-Speech API, ma può anche essere utilizzato nel lettore di schermo NVDA. Il creatore e principale sviluppatore di RHVoice è Olga Yakovleva, che porta avanti il progetto nonostante la completa cecità.
Nella versione 1.8 per la piattaforma Android è stata proposta un nuova sistema di gestione dei dati vocali e linguistici, che consente di caricare aggiornamenti dei dati vocali senza aggiornare l'app mobile. Il controllo della disponibilità di aggiornamenti per voci e lingue aggiuntive avviene automaticamente. Inoltre, nella nuova versione è stata implementata la supporto per la lingua polacca ed è stata aggiunta una nuova voce per la lingua macedone. È stata garantita la compatibilità con le recenti versioni alpha e beta del lettore di schermo NVDA. Sono stati risolti i problemi di compilazione sulla piattaforma Linux che si verificavano in assenza di Speech Dispatcher.
Ricordiamo che in RHVoice vengono applicati i contributi del progetto HTS (HMM/DNN-based Speech Synthesis System) e il metodo parametrico di sintesi con modelli statistici (Statistical Parametric Synthesis basato su HMM - Hidden Markov Model). Un vantaggio del modello statistico è il basso sovraccarico e il suo ridotto fabbisogno di potenza della CPU. Tutte le operazioni vengono eseguite localmente sul sistema dell'utente. Sono supportati tre livelli di qualità vocale (maggiore è la qualità, minore è la prestazione e più lungo è il tempo di risposta).
Un svantaggio del modello statistico è la qualità di pronuncia relativamente bassa, che non raggiunge il livello dei sintetizzatori che generano voce sulla base di combinazioni di frammenti di voce naturale; tuttavia, il risultato è comunque abbastanza comprensibile e ricorda la trasmissione di una registrazione tramite un altoparlante. A titolo di confronto, il progetto Silero, che offre un motore open source per la sintesi vocale basato su tecnologie di apprendimento automatico e un set di modelli per la lingua russa, supera RHVoice in termini di qualità.
Per la lingua russa sono disponibili 14 varianti vocali, per l'inglese 6. Le voci vengono generate sulla base di registrazioni della parlata naturale. Nelle impostazioni è possibile modificare la velocità, l'altezza e il volume. Per cambiare il ritmo può essere utilizzata la libreria Sonic. È possibile il riconoscimento automatico e il cambio della lingua in base all'analisi del testo in ingresso (ad esempio, per parole e citazioni in un'altra lingua può essere utilizzato il modello di sintesi nativo per quella lingua). Sono supportati i profili vocali, che definiscono le combinazioni di voci per diverse lingue.
Fonte: opennet.ru
