Пуснати е откритата система за синтез на реч RHVoice 1.6.0, първоначално разработена за качествена поддръжка на руския език, но след това адаптирана и за други езици, включително английски, португалски, украински, киргизки, татарски и грузински. Кодът е написан на C++ и се разпространява под лиценз LGPL 2.1. Поддържа работа в GNU/Linux, Windows и Android. Програмата е съвместима с типичните TTS интерфейси (text-to-speech) за преобразуване на текст в реч: SAPI5 (Windows), Speech Dispatcher (GNU/Linux) и Android Text-To-Speech API, но може да се използва и в екранен ридер NVDA. Създател на RHVoice и основен разработчик е Ольга Яковлева, която развива проекта въпреки пълната слепота.
В новата версия са добавени 5 нови варианта на гласове за руска реч. Реализирана е поддръжка на албански език. Обновен е речникът за украинския език. Разширена е поддръжката за озвучаване на символи emoji. Проведена е работа по отстраняване на грешки в приложението за платформата Android, опростен е импортът на потребителски речници, а също е добавена поддръжка за Android 11. В ядрото на движението са добавени нови настройки и функционалности, включително g2p.case, word_break и поддръжка на еквализационни филтри.
Напомняме, че в RHVoice се прилагат разработки от проекта HTS (HMM/DNN-based Speech Synthesis System) и параметричният метод за синтез със статистически модели (Statistical Parametric Synthesis на базата на HMM — Hidden Markov Model). Предимството на статистическата модел е ниските разходи и ненатовареността на CPU. Всички операции се извършват локално на системата на потребителя. Поддържат се три нива на качество на речта (колкото по-ниско е качеството, толкова по-висока е производителността и по-ниското време за реакция).
Недостатъкът на статистическата модел е относително ниското качество на произношението, което не достига нивото на синтезаторите, генериращи реч на база комбинация от фрагменти от естествена реч, но въпреки това резултатът е напълно разбираем и наподобява транслация на запис от говорител. За сравнение, проектът Silero, предлагащ отворен двигател за синтез на реч, базиран на технологии за машинно обучение и набор от модели за руския език, надминава RHVoice по качество.
За български език са налични 13 гласа, а за английски — 5. Гласовете се формират на базата на записи на естествена реч. В настройките може да се променя скоростта, височината и силата на звука. За промяна на темпото може да се използва библиотеката Sonic. Автоматичното разпознаване и превключване на езика е възможно чрез анализ на входящия текст (например, за думи и цитати на друг език може да се използва родната за този език модел за синтез). Подкрепят се гласови профили, които определят комбинации от гласове за различни езици.
Източник: opennet.ru
