Il Gruppo di aziende CRT, parte dell'ecosistema di Sberbank, ha annunciato lo sviluppo di una piattaforma avanzata di sintesi vocale, che, si afferma, garantisce fluidità ed espressività nella lettura di qualsiasi testo.
La soluzione presentata è la terza generazione del sistema di sintesi vocale. Un segnale audio di alta qualità è generato da complessi modelli di reti neurali. Gli sviluppatori affermano che il risultato di questi algoritmi è la sintesi della lingua russa più realistica.

La piattaforma comprende un modulo per la previsione delle accentuazioni nelle parole che non sono ancora nel dizionario di base. Inoltre, è previsto un correttore automatico degli errori ortografici tipici. Grazie a un'analisi linguistica approfondita del testo, la pronuncia corrisponderà alle norme della lingua anche in casi complessi.
Un altro punto di forza della piattaforma è che non richiede costose servers, dotate di acceleratori GPU. La tecnologia può essere utilizzata in due modi: tramite un servizio cloud o integrata in una propria soluzione.

Tra i possibili settori di applicazione della soluzione vengono menzionati chatbot e assistenti vocali, servizi di informazione e avviso, servizi vocali con sintesi immediata di qualsiasi testo durante una chiamata e altro ancora.
«Negli scenari automatizzati di comunicazione con i clienti, la tecnologia consente interazioni personalizzate con ogni abbonato, poiché non ci sono messaggi fissi e qualsiasi testo può essere sintetizzato durante la chiamata», affermano gli sviluppatori.
È possibile provare la tecnologia .
Fonte: 3dnews.ru
