Il gruppo di aziende CRT, parte dell'ecosistema di Sberbank, ha annunciato lo sviluppo di una piattaforma avanzata per la sintesi vocale, che, secondo quanto affermato, garantisce fluidità ed espressività nella lettura di qualsiasi testo.
La soluzione presentata rappresenta la terza generazione del sistema di sintesi vocale. Un segnale audio di alta qualità viene generato da complessi modelli di rete neurale. Gli sviluppatori sostengono che il risultato di questi algoritmi è la sintesi più realistica della lingua russa.

La piattaforma include un modulo per la previsione degli accenti nelle parole non presenti nel vocabolario di base. Inoltre, è prevista la correzione automatica di errori ortografici tipici. Grazie a un'analisi linguistica approfondita, la pronuncia sarà conforme alle norme della lingua anche in casi complessi.
Un altro vantaggio della piattaforma è che non richiede costose serverdotazioni con acceleratori GPU. La tecnologia può essere utilizzata in due modi: tramite un servizio cloud o integrandola nella propria soluzione.

Tra le possibili aree di applicazione, si citano chatbot e assistenti vocali, servizi di informazione e avviso, servizi vocali con sintesi istantanea di qualsiasi testo durante la chiamata, e altro ancora.
«Negli scenari automatizzati di interazione con i clienti, la tecnologia consente di interagire in modo personalizzato con ogni abbonato, poiché non ci sono messaggi fissi e qualsiasi testo può essere sintetizzato durante la chiamata», affermano gli sviluppatori.
Si può provare la tecnologia .
Fonte: 3dnews.ru
