Le modèle AI ouvert hertz-dev pour la communication vocale en duplex intégral a été publié.

La société Standard Intelligence a annoncé la publication de hertz-dev, le premier modèle AI open source pour la synthèse vocale en mode duplex intégral, pouvant servir de base à la création de systèmes de communication vocale en temps réel ou à la génération de discours conversationnel. Le modèle permet de produire une parole proche des données vocales sur lesquelles il a été formé, offrant une interaction dans un style similaire à celui d'une communication humaine en direct sans les retards caractéristiques d'une conversation téléphonique interrompue. Les avancées du projet sont distribuées sous la licence Apache 2.0.

Sur un système avec GPU NVIDIA GeForce RTX 4090, le délai moyen avant la génération est de 120 ms (théoriquement jusqu'à 65 ms), ce qui est environ deux fois plus rapide que les modèles existants disponibles en accès libre. La version publiée est construite en utilisant une architecture 'transformer', couvre 8,5 milliards de paramètres et a été formée en utilisant 500 milliards de tokens. La taille du contexte prise en compte par le modèle (le nombre de tokens que le modèle peut traiter et mémoriser lors de la génération de discours) est de 2048 tokens ou environ 4 minutes de discours.

Source : opennet.ru

Acheter un hébergement fiable pour les sites avec protection DDoS, serveurs VPS VDS 🔥 Acheter un hébergement fiable pour les sites avec protection DDoS, serveurs VPS VDS | ProHoster