Rilascio del sintetizzatore vocale RHVoice 1.6.0

È stato rilasciato RHVoice 1.6.0, un sistema open source di sintesi vocale inizialmente sviluppato per garantire un supporto di qualità per la lingua russa, ma successivamente adattato anche per altre lingue, tra cui inglese, portoghese, ucraino, kirghiso, tartaro e georgiano. Il codice è scritto in C++ e distribuito sotto la licenza LGPL 2.1. È supportato su GNU/Linux, Windows e Android. Il programma è compatibile con interfacce TTS standard (text-to-speech) per la conversione di testo in parlato: SAPI5 (Windows), Speech Dispatcher (GNU/Linux) e Android Text-To-Speech API, ma può anche essere utilizzato con il lettore di schermo NVDA. Il creatore e principale sviluppatore di RHVoice è Olga Yakovleva, che continua a sviluppare il progetto nonostante la completa cecità.

Nella nuova versione sono stati aggiunti 5 nuovi tipi di voci per il russo. È stata implementata la supporto per la lingua albanese. Aggiornato il dizionario per la lingua ucraina. È stata ampliata la supporto per la sintesi vocale dei simboli emoji. Sono stati effettuati lavori per risolvere i bug nell'applicazione per la piattaforma Android, semplificato l'import dei dizionari utente e aggiunta la supporto per Android 11. Sono state aggiunte nuove impostazioni e funzionalità al motore, inclusi g2p.case, word_break e supporto per filtri di equalizzazione.

Ricordiamo che RHVoice si basa sui risultati del progetto HTS (HMM/DNN-based Speech Synthesis System) e utilizza un metodo parametrico di sintesi con modelli statistici (Statistical Parametric Synthesis basato su HMM — Modello di Markov Nascosto). Il vantaggio dei modelli statistici è rappresentato dai bassi costi operativi e dalla non richiesta di potenza CPU. Tutte le operazioni vengono eseguite localmente sul sistema dell'utente. Sono supportati tre livelli di qualità vocale (minore è la qualità, maggiore è le prestazioni e minore è il tempo di risposta).

Un aspetto negativo del modello statistico è la qualità relativamente bassa della pronuncia, che non raggiunge il livello dei sintetizzatori che generano discorsi basati su una combinazione di frammenti di discorso naturale. Tuttavia, il risultato è abbastanza intelligibile e ricorda una registrazione trasmessa tramite un altoparlante. A titolo di confronto, il progetto Silero, che offre un motore di sintesi vocale open-source basato su tecnologie di machine learning e un insieme di modelli per la lingua russa, supera RHVoice in qualità.

Per la lingua russa sono disponibili 13 varianti vocali, mentre per l'inglese sono 5. Le voci sono create sulla base di registrazioni di linguaggio naturale. Nelle impostazioni è possibile modificare la velocità, l'altezza e il volume. Per cambiare il tempo può essere utilizzata la libreria Sonic. È possibile il riconoscimento automatico e il cambio della lingua basato sull'analisi del testo in ingresso (ad esempio, per parole e citazioni in un'altra lingua può essere utilizzato il modello di sintesi nativo per quella lingua). Sono supportati profili vocali che definiscono le combinazioni di voci per diverse lingue.

Fonte: opennet.ru

Acquista hosting affidabile per siti web con protezione DDoS, VPS VDS server 🔥 Acquista hosting affidabile per siti web con protezione DDoS, VPS VDS server | ProHoster