Състоя се издаването на отворената система за синтез на реч RHVoice 1.8.0, която първоначално е разработвана с цел качествена поддръжка на руския език, но след това е адаптирана и за други езици, включително английски, португалски, украински, киргизки, татарски и грузински. Кодът е написан на C++ и се разпространява под лиценз LGPL 2.1. Поддържа работа в GNU/Linux, Windows и Android. Програмата е съвместима с типичните TTS-интерфейси (text-to-speech) за преобразуване на текст в реч: SAPI5 (Windows), Speech Dispatcher (GNU/Linux) и Android Text-To-Speech API, но също така може да се използва в екранния ридер NVDA. Създател и основен разработчик на RHVoice е Олга Яковлева, която развива проекта въпреки пълната слепота.
В версия 1.8 за платформата Android е предложена нова система за управление на гласовите и езиковите данни, позволяваща да се зареждат обновления на гласовите данни без необходимост от обновление на мобилното приложение. Проверка за наличие на обновления на данните за добавените гласове и езици се извършва автоматично. Освен това, в новото издание е реализирана поддръжка на полския език и е добавен нов глас за македонския език. Осигурена е съвместимост с последните алфа и бета версии на екранния ридер NVDA. Премахнати са проблемите със сглобяването на платформата Linux, които се появяваха при отсъствието на Speech Dispatcher.
Напомняме, че в RHVoice се използват разработки от проекта HTS (HMM/DNN-based Speech Synthesis System) и параметричният метод на синтез със статистически модели (Statistical Parametric Synthesis на база HMM — Hidden Markov Model). Предимството на статистическия модел е ниската накладност и ненуждата от мощност на CPU. Всички операции се изпълняват локално на системата на потребителя. Поддържат се три нива на качество на речта (колкото по-ниско е качеството, толкова по-висока е производителността и по-малко е времето за реакция).
Недостатък на статистическия модел е сравнително ниското качество на произношението, което не достига нивото на синтезаторите, генериращи реч на базата на комбинация от фрагменти на естествена реч, но все пак резултатът е напълно разбираем и напомня на транслация на запис от говорител. За сравнение, проектът Silero, предлагащ отворен двигател за синтез на реч на базата на технологии за машинно обучение и набор от модели за руския език, превъзхожда RHVoice по качество.
За руския език са налични 14 варианта на гласове, а за английския — 6. Гласовете са оформени на базата на записи на естествена реч. В настройките можете да променяте скоростта, височината и силата на звука. За промяна на темпото може да се използва библиотеката Sonic. Възможно е автоматично определяне и превключване на езика на базата на анализа на входния текст (например, за думи и цитати на друг език може да се използва родна за този език модел на синтез). Поддържат се гласови профили, определящи комбинации от гласове за различни езици.
Източник: opennet.ru
