Uscita del sintetizzatore vocale RHVoice 1.8.0

È stato rilasciato il sistema di sintesi vocale open source RHVoice 1.8.0, originariamente sviluppato per garantire un supporto di alta qualità per la lingua russa, ma successivamente adattato anche per altre lingue, tra cui inglese, portoghese, ucraino, kirghizo, tartaro e georgiano. Il codice è scritto in C++ e distribuito sotto la licenza LGPL 2.1. Supporta l'operatività su GNU/Linux, Windows e Android. Il programma è compatibile con le interfacce TTS standard (text-to-speech) per la conversione del testo in voce: SAPI5 (Windows), Speech Dispatcher (GNU/Linux) e Android Text-To-Speech API, ma può anche essere utilizzato nel lettore di schermo NVDA. Il creatore e principale sviluppatore di RHVoice è Olga Yakovleva, che continua a sviluppare il progetto nonostante la cecità totale.

Nella versione 1.8 per la piattaforma Android è stata introdotta una nuova sistema di gestione dei dati vocali e linguistici, che permette di caricare aggiornamenti dei dati vocali senza aggiornare l'app mobile. Il controllo della disponibilità di aggiornamenti per le lingue e le voci aggiunte viene effettuato automaticamente. Inoltre, in questa nuova release è stata aggiunta la supporto per la lingua polacca e una nuova voce per la lingua macedone. È stata garantita la compatibilità con le ultime versioni alfa e beta del lettore di schermo NVDA. Sono stati risolti i problemi di compilazione sulla piattaforma Linux che si verificavano in assenza di Speech Dispatcher.

Ricordiamo che RHVoice si basa sui risultati del progetto HTS (HMM/DNN-based Speech Synthesis System) e utilizza un metodo parametrico di sintesi con modelli statistici (Statistical Parametric Synthesis basato su HMM — Modello di Markov Nascosto). Il vantaggio dei modelli statistici è rappresentato dai bassi costi operativi e dalla non richiesta di potenza CPU. Tutte le operazioni vengono eseguite localmente sul sistema dell'utente. Sono supportati tre livelli di qualità vocale (minore è la qualità, maggiore è le prestazioni e minore è il tempo di risposta).

Un aspetto negativo del modello statistico è la qualità relativamente bassa della pronuncia, che non raggiunge il livello dei sintetizzatori che generano discorsi basati su una combinazione di frammenti di discorso naturale. Tuttavia, il risultato è abbastanza intelligibile e ricorda una registrazione trasmessa tramite un altoparlante. A titolo di confronto, il progetto Silero, che offre un motore di sintesi vocale open-source basato su tecnologie di machine learning e un insieme di modelli per la lingua russa, supera RHVoice in qualità.

Per la lingua russa sono disponibili 14 varianti vocali, mentre per l'inglese ce ne sono 6. Le voci sono create sulla base di registrazioni di parlato naturale. Nelle impostazioni è possibile modificare la velocità, il tono e il volume. La libreria Sonic può essere utilizzata per modificare il ritmo. È possibile l'identificazione automatica e il cambio lingua, basato sull'analisi del testo in ingresso (ad esempio, per parole e citazioni in un'altra lingua può essere utilizzato un modello di sintesi nativo per quella lingua). Sono supportati profili vocali che definiscono combinazioni di voci per diverse lingue.

Fonte: opennet.ru

Acquista hosting affidabile per siti web con protezione DDoS, VPS VDS server 🔥 Acquista hosting affidabile per siti web con protezione DDoS, VPS VDS server | ProHoster