Kompania Standard Intelligence shpalli publikimin e hertz-dev, modeli i parë hapur AI për sintezën e zërit në modin dyfish, i cili mund të përdoret si bazë për krijimin e sistemeve të komunikimit me zë në kohë reale ose gjenerimin e zërit konversacional. Modeli lejon gjenerimin e zërit të ngjashëm me të dhënat zërore mbi të cilat është trajnuar, duke siguruar ndërveprimin në stilin e komunikimit njerëzor të drejpërdrejtë pa vonesa, të ngjashme me një bisedë telefonike të ndërprerë. Rrethanat e projektit përhapet nën licencën Apache 2.0.
Në një sistem me GPU NVIDIA GeForce RTX 4090, vonesa mesatare përpara gjenerimit është 120 ms (teorikisht deri në 65 ms), që është afërsisht dyfish më e shpejtë se modelet ekzistuese që janë në dispozicion publik. Versioni i publikuar është ndërtuar duke përdorur arkitekturën "transformer", mbulon 8.5 miliard parametra dhe është trajnuar me 500 miliard tokena. Madhësia e kontekstit që modeli merr parasysh (numri i tokenave që modeli mund të përpunojë dhe mbajë mend gjatë gjenerimit të zërit) është 2048 tokena ose afërsisht 4 minuta zë.
Burimi: opennet.ru
