A fost publicat modelul AI deschis hertz-dev pentru comunicarea vocală duplex complet

Compania Standard Intelligence a anunțat lansarea hertz-dev, primul model AI deschis pentru sinteza vocală în mod duplex, care poate fi folosit ca bază pentru crearea de sisteme de comunicare vocală în timp real sau generarea de discurs conversațional. Modelul permite generarea de voce, similară cu datele vocale pe care a fost antrenată, asigurând interacțiuni în stilul comunicării umane directe, fără întârzieri care să aducă aminte de un apel telefonic întrerupt. Rezultatele proiectului sunt distribuite sub licența Apache 2.0.

Pe un sistem cu GPU NVIDIA GeForce RTX 4090, întârzierea medie înainte de generare este de 120 ms (teoretic până la 65 ms), ceea ce este aproximativ de două ori mai rapid decât modelele existente disponibile public. Varianta publicată este construită utilizând arhitectura „transformer”, acoperind 8.5 miliarde de parametri și fiind antrenată cu 500 de miliarde de tokeni. Dimensiunea contextului considerat de model (numărul de tokeni pe care modelul îi poate procesa și reține în timpul generării vocii) este de 2048 tokeni sau aproximativ 4 minute de discurs.

Sursa: opennet.ro

Cumpără un hosting fiabil pentru site-uri cu protecție DDoS, servere VPS VDS 🔥 Cumpără un hosting fiabil pentru site-uri cu protecție DDoS, servere VPS VDS | ProHoster