Das Unternehmen Standard Intelligence hat die Veröffentlichung von hertz-dev, dem ersten offenen KI-Modell für die Sprachsynthese im Vollduplexmodus, angekündigt, das als Grundlage für die Erstellung von Systemen zur sprachlichen Kommunikation in Echtzeit oder zur Generierung gesprochener Sprache verwendet werden kann. Das Modell ermöglicht es, Sprache zu erzeugen, die nah an den Sprachdaten ist, auf denen es trainiert wurde, und gewährleistet eine Interaktion im Stil menschlichen Gesprächs ohne Verzögerungen, die an ein unterbrochenes Telefongespräch erinnern. Die Ergebnisse des Projekts werden unter der Lizenz Apache 2.0 veröffentlicht.
Auf einem System mit einer NVIDIA GeForce RTX 4090 beträgt die durchschnittliche Verzögerung vor der Generierung 120 ms (theoretisch bis zu 65 ms), was etwa doppelt so schnell ist wie bei den verfügbaren bestehenden Modellen. Die veröffentlichte Version wurde unter Verwendung der "Transformer"-Architektur erstellt, umfasst 8,5 Milliarden Parameter und wurde mit 500 Milliarden Token trainiert. Die Kontextgröße, die das Modell berücksichtigt (die Anzahl der Token, die das Modell bei der Sprachgenerierung verarbeiten und sich merken kann), beträgt 2048 Token oder etwa 4 Minuten Sprache.
Quelle: opennet.ru
