Një version i ri publik i sistemit të sintësisë së zërit Silero Text-to-Speech është tani në dispozicion. Projekti është kryesisht i fokusuar në krijimin e një sistemi modern të sintësisë së zërit me cilësi të lartë, i cili nuk i përtërit zgjidhjeve tregtare nga korporatat dhe është i aksesueshëm për të gjithë që dëshirojnë, pa përdorur pajisje serverike të shtrenjta.
Modelet shpërndahen nën licencën GNU AGPL, por kompania që zhvillon projektin nuk zbulon mekanizmat e stërvitjes së modeleve. Për ta drejtuar atë, mund të përdorni PyTorch dhe kuadrot me mbështetje për formatin ONNX. Sintesa e zërit në Silero bazohet në përdorimin e algoritmeve dhe metodave moderne të përpunimit të sinjalit të modifikuara thellësisht.
Vërehet se problemi kryesor i zgjidhjeve moderne të sintësisë së zërit është se shpesh ato janë në dispozicion vetëm brenda zgjidhjeve të kushtueshme cloud, ndërsa produktet publike kanë kërkesa të larta për pajisje, cilësi më të ulët ose nuk janë produkte të plota dhe të gatshme për përdorim. Për shembull, për të drejtuar pa probleme një nga arkitekturën e re popullore të sintësisë end-to-end, VITS, në modin e sintësisë (pra, jo për stërvitjen e modeleve) kërkohen karta grafike me më shumë se 16 gigabajt VRAM.
Përkundër trendit të vendosur, zgjidhjet Silero funksionojnë me sukses edhe në një rrjedhë të procesorit x86 Intel me instrukcione AVX2. Në 4 rrjedha të procesorit, sintesa lejon të sintesohet nga 30 deri në 60 sekonda në sekondë në modin e sintësisë 8 kHz, në modin 24 kHz — 15-20 sekonda, dhe në modin 48 kHz — rreth 10 sekonda.
Karakteristikat kryesore të versionit të ri të Silero:
- Madhësia e modelit është zvogëluar me 2 herë në 50 megabajt;
- Modelet janë në gjendje të bëjnë pauza;
- Janë në dispozicion 4 zëra të cilësisë së lartë në gjuhën ruse (dhe një_numër të pafundme random). Shembuj të shqiptimit;
- Modelet janë bërë 10 herë më të shpejtë dhe, për shembull, në modin 24 kHz lejojnë të sintetizojnë deri në 20 sekonda audio në sekondë në 4 rrjedha të procesorit;
- Të gjitha variantet e zërit për një gjuhë janë të paketuar në një model;
- Modelet mund të pranojnë paragrafë të tërë teksti si input, mbështeten etiketat SSML;
- Sintesa funksionon menjëherë në tre frekuenca të ndryshme; 8, 24 dhe 48 kilohertz;
- Problemet "fëmijë" janë zgjidhur: pasiguria dhe mungesa e fjalëve;
- Janë shtuar flamuj për të kontrolluar vendosjen automatike të theksit dhe vendosjen e shkronjës "ё".
Aktualisht, për versionin më të ri të sintësisë janë në dispozicion publikisht 4 zëra në gjuhën ruse, por në të ardhmen e afërt do të publikohet një version tjetër me ndryshime të mëposhtme:
- Shpejtësia e sintësisë do të rritet me 2-4 herë më shumë;
- Modelet e sintësisë për gjuhët e CIS do të përmirësohen: Kalmyk, Tatar, Uzbek dhe Ukrainas;
- Do të shtohen modelet për gjuhët evropiane;
- Do të shtohen modelet për gjuhët indiane;
- Do të shtohen modelet për gjuhën angleze.
Disa nga problemet sistemike që i përkasin sintësisë Silero:
- Ndryshe nga zgjidhjet më tradicionale për sintësinë, si RHVoice, sintesa Silero nuk ka integrim me SAPI, klientë të lehtë për t'u instaluar dhe integrime për Windows dhe Android;
- Shpejtësia, edhe pse është paprecedent e lartë për një zgjidhje të tillë, mund të jetë e pamjaftueshme për sintesën në flakë në procesorë të dobët në cilësi të lartë;
- Zgjidhja për vendosjen automatike të theksit nuk i trajton omografët (fjalë si zАмок dhe замОк) dhe ende bën gabime, por kjo papërsosmëri do të rregullohet në versionet e ardhshme;
- Versioni aktual i sintësisë në thelb ka si varësi të vetme PyTorch, e gjithë përmbajtja është "e shkruar" brenda modelit dhe paketave JIT. Burimet e modeleve nuk publikohen, as si kodi për drejtuar modelet nga klientë PyTorch për gjuhë të tjera;
- Libtorch, i disponueshëm për platformat mobile, është shumë më i rëndë se ONNX runtime, por versioni ONNX i modelit ende nuk ofrohet.
- Libtorch, доступный для мобильных платформ, гораздо более громоздкий, чем ONNX runtime, но ONNX-версия модели пока не предоставляется.
Burimi: opennet.ru
