Avaldatud on AI mudel ChatTTS kõnesünteesi jaoks.

ChatTTS projekt on avaldanud mudeli ja sellega seotud masinõppe tööriistad emotsionaalse kõne süntseerimiseks. ChatTTS projekt on spetsiaalselt optimeeritud kasutamiseks dialooge süsteemides, nagu interaktiivsed assistendid, ja selle eesmärk on jäljendada loomuliku emotsionaalse suhtlemise omadusi. Toetatakse mitme kõneleja vaheline suhtlemine ja interaktiivse dialooge loomine. Sünteesi käigus jälgitakse ja taasesitatakse korrektset prosodika elemente, nagu naer, pausid ja interjektsioonid.

Mudeli koolitamiseks kasutati umbes 40 000 tunni jagu häälekirjeid (avalikustamata mudeli variandi puhul — 100 000 tundi). Arendajate sõnul ületab mudel oma võimekusega intonatsioonide genereerimist kõik varasemalt saadaval olnud avatud kõnesünteesi mudelid. Emotsioonide juhtimiseks sünteesi ajal toetatakse praeguseks vaid tokeneid, näiteks "[laugh]" naeru jaoks. 30-sekundilise salvestuse genereerimiseks on vajalik 4 GB mäluga GPU. NVIDIA GeForce RTX 4090D GPU korral on genereerimise kiirus ligikaudu 7 semantilist tokenit sekundis. Sünteesi toetatakse inglise ja hiina keeles nii meeste kui naiste häälega (vene keele jaoks on soovitatav TTS raamistik ja XTTS-v2 mudel, mis toetab lisaks sünteesile ka hääle kloonimist lühikese häälekirje alusel, sealhulgas sünteesi teises keeles).

ChatTTS mudel on avaldatud CC BY-NC-ND 4.0 (Creative Commons Attribution-NonCommercial-NoDerivatives 4.0) litsentsi alusel, mis võimaldab tasuta levitamist autori mainimisega, kuid keelab tuletiste loomise ja kasutamise kaubanduslikes projektides. Lisaks on mudeli kasutamise vältimiseks pettuste ja kuritegevuse eesmärgil mudeli koolitamisel kasutatud kõrge sagedusega müra ning rakendatud maksimaalne helisuru tase, kasutades MP3 formaati.

Allikas: opennet.ru

Osta usaldusväärne veebihosting DDoS kaitsega, VPS VDS serverid 🔥 Osta usaldusväärne veebihosting DDoS kaitsega, VPS VDS serverid | ProHoster