È stato pubblicato il modello AI aperto hertz-dev per comunicazioni vocali full-duplex.

La società Standard Intelligence ha annunciato il rilascio di hertz-dev, il primo modello AI open source per la sintesi vocale in modalità full duplex, che può essere utilizzato come base per la creazione di sistemi di comunicazione vocale in tempo reale o per la generazione di discorsi conversazionali. Il modello consente di generare una voce simile ai dati vocali su cui è stato addestrato, garantendo un'interazione nello stile della comunicazione umana dal vivo, senza ritardi che ricordano una conversazione telefonica interrotta. I risultati del progetto sono distribuiti sotto licenza Apache 2.0.

Su un sistema con GPU NVIDIA GeForce RTX 4090, il tempo medio di latenza prima della generazione è di 120 ms (teoricamente fino a 65 ms), che è circa il doppio più veloce rispetto ai modelli esistenti disponibili pubblicamente. La versione pubblicata è costruita utilizzando l'architettura 'transformer', copre 8,5 miliardi di parametri ed è stata addestrata utilizzando 500 miliardi di token. La dimensione del contesto considerata dal modello (il numero di token che il modello può elaborare e ricordare durante la generazione del discorso) è di 2048 token o circa 4 minuti di discorso.

Fonte: opennet.ru

Acquista hosting affidabile per siti web con protezione DDoS, VPS VDS server 🔥 Acquista hosting affidabile per siti web con protezione DDoS, VPS VDS server | ProHoster