Die Firma Standard Intelligence hat die Veröffentlichung von hertz-dev bekannt gegeben, dem ersten offenen KI-Modell zur Sprachsynthese im Vollduplexmodus. Dieses kann als Grundlage für die Entwicklung von Systemen für die Echtzeit-Sprachkommunikation oder die Generierung gesprochener Sprache dienen. Das Modell ermöglicht die Erzeugung von Sprache, die den Sprachdaten, auf denen es trainiert wurde, nahekommt, und schafft Interaktionen im Stil eines echten menschlichen Gesprächs ohne Verzögerungen, wie sie in einem abgehackten Telefongespräch auftreten können. Die Ergebnisse des Projekts werden unter der Apache 2.0-Lizenz veröffentlicht.
Auf einem System mit einer NVIDIA GeForce RTX 4090 beträgt die durchschnittliche Latenz vor der Generierung 120 ms (theoretisch bis zu 65 ms), was etwa doppelt so schnell ist wie bei bestehenden offenen Modellen. Die veröffentlichte Version basiert auf einer Transformator-Architektur, umfasst 8,5 Milliarden Parameter und wurde mit 500 Milliarden Tokens trainiert. Die von dem Modell berücksichtigte Kontextgröße (die Anzahl der Tokens, die das Modell bei der Sprachgenerierung verarbeiten und sich merken kann) beträgt 2048 Tokens oder etwa 4 Minuten Sprache.
Quelle: opennet.ru
