Firma Standard Intelligence ogłosiła opublikowanie hertz-dev, pierwszego otwartego modelu AI do syntezowania mowy w trybie pełnodupleksowym, który może być używany jako podstawa do tworzenia systemów komunikacji głosowej w czasie rzeczywistym lub generowania mowy konwersacyjnej. Model pozwala na generowanie mowy zbliżonej do danych głosowych, na których został wytrenowany, zapewniając interakcję w stylu żywego ludzkiego dialogu bez opóźnień przypominających przerywane rozmowy telefoniczne. Osiągnięcia projektu są udostępniane na licencji Apache 2.0.
Na systemie z GPU NVIDIA GeForce RTX 4090 średnie opóźnienie przed generacją wynosi 120 ms (teoretycznie do 65 ms), co jest około dwa razy szybsze niż w przypadku dostępnych w otwartym dostępie istniejących modeli. Opublikowana wersja została zbudowana z wykorzystaniem architektury «transformer», obejmuje 8,5 miliarda parametrów i została wyuczona przy użyciu 500 miliardów tokenów. Rozmiar kontekstu brane pod uwagę przez model (liczba tokenów, które model może przetwarzać i zapamiętywać podczas generowania mowy) wynosi 2048 tokenów lub około 4 minuty mowy.
Źródło: opennet.ru
