Saadaval on uus avalik väljaanne Silero Text-to-Speechi närvivõrgu kõnesüntesaatorist. Projekt keskendub eelkõige kaasaegse kõrgekvaliteedilise kõnesüntesaatori loomiseks, mis ei jää alla ettevõtete kommertslahendustele ja on kõigile soovijatele kergesti kättesaadav ilma kallite serverite kasutamiseta.
Mudelite levitamine toimub GNU AGPL litsentsi alusel, kuid projekti arendav ettevõte ei avalikusta mudelite koolitamise mehhanismi. Käivitamiseks saab kasutada PyTorch'i ja raamistikke, mis toetavad ONNX formaati. Silero kõnesüntees põhineb sügavalt muudetud kaasaegsete närvivõrkude algoritmide ja digitaalsete signaalitöötluse meetodite kasutamisel.
Märgitakse, et kaasaegsete närvivõrkude kõnesynthesis lahenduste peamiseks probleemiks on see, et need on sageli saadaval ainult tasuliste pilvelahenduste raames, samas kui avalikud tooted nõuavad kõrgeid riistvaranõudeid, pakuvad madalamat kvaliteeti või ei ole lõpetatud ja kasutamiseks valmis tooted. Näiteks ühe uue populaarse end-to-end sünkroniseerimise arhitektuuri, VITS, probleemideta käivitamiseks sünkrooni (st mitte mudelite koolitamiseks) on vajalikud rohkem kui 16 GB VRAM-iga videokaardid.
Vaatamata kehtestatud trendile töötab Silero lahendused edukalt isegi 1 x86 Intel protsessori lõimega, millel on AVX2 käsklused. Nelja lõime protsessori korral võimaldab sünkroniseerimine sünkroniseerida 30–60 sekundi jooksul 8 kHz režiimis, 24 kHz režiimis 15–20 sekundi ning 48 kHz režiimis umbes 10 sekundi jooksul.
Uue Silero väljundi põhijooned:
- Mudel on kärbitud kaks korda 50 megabaiti;
- Mudelid oskavad pausid teha;
- Saadaval on 4 kõrge kvaliteediga häält vene keeles (ja lõputu arv juhuslikke). Häälduse näited;
- Mudelite kiirus on kümme korda suurem ja näiteks 24 kHz režiimis on võimalik ühe sekundi jooksul sünteesida kuni 20 sekundit heli neljal protsessori voolul;
- Kõik hääljuhised ühes keeles on pakitud ühte mudelisse;
- Mudelid toetavad täistekste ning sisendiks on ka SSML-sildid;
- Süntees töötab kolmes valimis — 8, 24 ja 48 kHz;
- On lahendatud «tõrva probleemid»: ebastabiilsus ja sõnade vahelejätmine;
- Lisatud lipud automaatse rõhude ja tähe 'ё' paigutuse kontrollimiseks.
Praegu on uusima sünteesi versiooni jaoks avalikult saadaval neli häält vene keeles, kuid peagi avaldatakse järgmine versioon järgmiste muudatustega:
- Sünteesi kiirus suureneb veel 2-4 korda;
- Uuendatakse sünteesi mudeleid SRÜ keelte jaoks: Kalmi, Tatar, Usbeki ja Ukraina keele jaoks;
- Lisatakse mudeleid Euroopa keelte jaoks;
- Lisatakse mudeleid India keelte jaoks;
- Lisatakse mudeleid inglise keele jaoks.
Mõned süsteemsete probleemidega, mis on Silero sünteesile iseloomulikud:
- Erinevalt traditsioonilisematest sünteesisüsteemidest nagu RHVoice, puudub Silero sünteesis SAPI integreerimine, kergesti installitavad kliendid ning integratsioonid Windowsi ja Androidi jaoks;
- Kiirus, kuigi see on sellise lahenduse jaoks enneolematu, võib olla nõrkade protsessorite puhul kõrge kvaliteedi reaalajas sünteesi jaoks ebapiisav;
- Automaatse rõhuasetuse lahendus ei tööta homograafide (nt zAmok ja zamOk) puhul ja teeb endiselt vigu, kuid see puudus on tulevastes versioonides parandamiseks plaanis;
- Praegune sünteesiversioon ei tööta protsessoritel, kus puuduvad AVX2 käsud (või tuleb PyTorch-i seadeid eriliselt kohandada), kuna üks moodul mudeli sees on kvantiseeritud;
- Praegune süntezis sõltub põhimõtteliselt ainult PyTorchist, kogu sisu on mudeli ja JIT-pakettide sisse ehitatud. Mudelite allikaid ei avalikustata, samuti ei ole koodi, et käivitada mudeleid PyTorchi klientidest teiste keelte jaoks;
- Mobiiliplatvormidele mõeldud Libtorch on oluliselt mahukam kui ONNX runtime, kuid ONNX-versioon mudelist ei ole praegu saadaval.
Allikas: opennet.ru
