Saadaval on uus avalik väljaanne Silero Text-to-Speech kõnesünteesimise neuronaalsüsteemist. Projekt on eelkõige suunatud kaasaegse kvaliteetse kõnesünteesi süsteemi loomisele, mis ei jää alla suurkorporatsioonide kommertslahendustele ja on kõigile soovijatele kergesti kättesaadav ilma kallite serveritega.
Mudeleid jagatakse GNU AGPL litsentsi alusel, kuid projekti arendav ettevõte ei avalikusta mudelite koolitamise mehhanismi. Käivitamiseks võib kasutada PyTorch'i ja raamistikku, mis toetab ONNX formaati. Silero kõnesüntees põhineb sügavalt muudetud kaasaegsetel neuronaalsetel algoritmidel ja digitaalse signaalitöötluse meetoditel.
Tuleb märkida, et tänapäeva neuronaalsete kõnesünteesi lahenduste peamine probleem on see, et need on sageli saadaval ainult tasuliste pilvelahenduste raames, samas kui avalikud tooted omavad kõrgeid riistvaranõudeid, madalamat kvaliteeti või pole valminud ja valmis kasutamiseks. Näiteks, et probleemideta käivitada üks uus populaarne end-to-end kõnesünteesi arhitektuur, VITS, sünteesi režiimis (st mitte mudelite treenimiseks), on vajalikud graafikakaardid, millel on üle 16 gigabaiti VRAM-i.
Vaatamata kehtestatud trendile, käivituvad Silero lahendused edukalt isegi 1 voog x86 Intel protsessoril, millel on AVX2 käsud. 4 voolus võimaldab sünteesida 30 kuni 60 sekundit sekundis 8 kHz režiimis, 24 kHz režiimis 15-20 sekundi ja 48 kHz režiimis umbes 10 sekundit.
Uue Silero väljaande peamised omadused:
- Mudeli suurus on kahekordistunud 50 megabaidini;
- Mudelid suudavad teha pause;
- Saadaval on 4 kõrgekvaliteedilist häält vene keeles (ja lõputu arv juhuslikke). Hääldamise näited;
- Mudelid on 10 korda kiiremaks muutunud ja näiteks 24 kHz režiimis võimaldavad kuni 20 sekundi audio sünteesi sekundis 4 voolus;
- Kõik häälevariandid ühe keele jaoks on pakitud ühte mudelisse;
- Mudelid võivad vastu võtta terveid tekstilõike, toetatakse SSML-märke;
- Süntees töötab kohe kolmes erinevas diskreetimissageduses valikuna — 8, 24 ja 48 kHz;
- Lahendatud on "lasteprobleemid": ebastabiilsus ja sõnade vahelejätmine;
- Lisatud on lipud automaatse rõhu ja tähe "ё" paigutamise kontrollimiseks.
Praegu on uusima versiooni sünteesiks avalikult saadaval 4 häält vene keeles, kuid varsti avaldatakse järgmine versioon järgmiste muudatustega:
- Sünteesi kiirus suureneb veel 2-4 korda;
- Sünteesi mudelid KSG riikide jaoks, sealhulgas kalmuki, tatari, usbeki ja ukraina keele jaoks, uuendatakse;
- Mudelite juurde lisatakse Euroopa keeltes;
- Mudelite juurde lisatakse India keeltes;
- Mudelite juurde lisatakse ka inglise keele jaoks.
Mõned süsteemi probleemid, mis on seotud Silero sünteesi:
- Erinevalt traditsioonilisematest sünteesi lahendustest, nagu RHVoice, ei ole Silero sünteesi lahendusel SAPI integreerimist, lihtsaid paigaldatavaid kliente ja integreerimisi Windowsile ja Androidile;
- Kuigi kiirus on selle lahenduse jaoks enneolematult kõrge, ei pruugi see nõrkadel protsessoritel kõrgema kvaliteediga reaalajas sünteesi jaoks olla piisav;
- Automaatse rõhu seadistamise lahendus ei käsitle omograafe (sõnad nagu zAmok ja zamOk) ja teeb endiselt vigu, kuid see puudus parandatakse tulevastes väljaannetes;
- Praegune sünteesi versioon ei tööta protsessorites ilma AVX2 juhisteta (või on vajalik spetsiaalne PyTorchi seadistamine), kuna üks mudeli moodulitest on kvantitud;
- Praegune sünteesi versioon vajab põhimõtteliselt ainult PyTorchi sõltuvust, kogu sisu on mudeli ja JIT-pakettide sisse ehitatud. Mudelite lähtekood ei ole avaldatud, samuti ei ole kodu-kliendi PyTorchi mudelite käivitamise koodi;
- Mobiiliplattformide jaoks saadaval oleval Libtorchil on palju suurem koormus kui ONNX runtime'il, kuid ONNX versioon mudelist ei ole veel saadaval.
Allikas: opennet.ru
