L'azienda Standard Intelligence ha annunciato la pubblicazione di hertz-dev, il primo modello AI open source per la sintesi vocale in modalità full-duplex, che può essere utilizzato come base per la creazione di sistemi di comunicazione vocale in tempo reale o per la generazione di discorsi conversazionali. Il modello consente di generare una voce simile ai dati vocali su cui è stato addestrato, garantendo un'interazione nello stile della comunicazione umana dal vivo senza ritardi, che ricordano una conversazione telefonica interrotta. I risultati del progetto sono distribuiti con licenza Apache 2.0.
Su un sistema con GPU NVIDIA GeForce RTX 4090, il ritardo medio prima della generazione è di 120 ms (teoricamente fino a 65 ms), che è circa due volte più veloce rispetto ai modelli esistenti disponibili al pubblico. La versione pubblicata è costruita utilizzando l'architettura 'trasformatore', coprendo 8,5 miliardi di parametri e addestrata utilizzando 500 miliardi di token. La dimensione del contesto considerato dal modello (il numero di token che il modello può elaborare e memorizzare durante la generazione della voce) è di 2048 token o circa 4 minuti di discorso.
Fonte: opennet.ru
