Kompania Standard Intelligence njoftoi publikimin e hertz-dev, modeli i parë i hapur AI për sintesën e zërit në mënyrë të dyanshme, i cili mund të përdoret si një bazë për krijimin e sistemeve të komunikimit me zë në kohë reale ose për gjenerimin e fjalës së bisedës. Modeli mundëson gjenerimin e fjalës që është e ngjashme me të dhënat e zërit mbi të cilat është trajnuar, duke siguruar ndërveprimin në stilin e komunikimit të jetuar të njeriut pa vonesa që kujtojnë një bisedë telefonike të ndërprerë. Rezultatet e projektit shpërndahen nën licencën Apache 2.0.
Në një sistem me GPU NVIDIA GeForce RTX 4090, vonesa mesatare para gjenerimit është 120 ms (teorikisht deri në 65 ms), që është afërsisht dy herë më e shpejtë se modelet ekzistuese të disponueshme publikisht. Variante e publikuar është ndërtuar me arkitekturën "transformer", mbulon 8.5 miliard parametra dhe është trajnuar duke përdorur 500 miliard tokena. Madhësia e kontekstit të marrë në konsideratë nga modeli (numri i tokenave që modeli mund të përpunojë dhe mbajë mend gjatë gjenerimit të të folurit) është 2048 tokena ose afërsisht 4 minuta të folur.
Burimi: opennet.ru
