Google a publié le code audio open source Lyra V2

La société Google a présenté le codec audio Lyra V2, qui utilise des méthodes d'apprentissage machine pour atteindre une qualité maximale de transmission de la parole sur des canaux de communication très lents. La nouvelle version se distingue par un passage à une nouvelle architecture de réseau neuronal, un support de plateformes supplémentaires, des capacités de contrôle de débit améliorées, une augmentation des performances et une qualité sonore supérieure. L'implémentation de référence du code est écrite en C++ et est distribuée sous la licence Apache 2.0.

En termes de qualité des données vocales transmises à faibles débits, Lyra dépasse nettement les codecs traditionnels utilisant des méthodes de traitement numérique du signal. Pour atteindre une haute qualité de transmission vocale dans des conditions de volume de données limité, Lyra applique, en plus des méthodes habituelles de compression audio et de transformation de signaux, un modèle de parole basé sur un système d'apprentissage machine, permettant de recréer les informations manquantes en se basant sur des caractéristiques types de la parole.

Le codec comprend un encodeur et un décodeur. L'algorithme de fonctionnement de l'encodeur consiste à extraire les paramètres des données vocales toutes les 20 millisecondes, à les compresser et à les transmettre au destinataire via le réseau avec un débit de 3,2 kbps à 9,2 kbps. Du côté du destinataire, le décodeur utilise un modèle génératif pour recréer le signal vocal original sur la base des paramètres sonores transmis, qui comprennent des mél-spectrogrammes logarithmiques tenant compte des caractéristiques énergétiques de la parole dans différentes bandes de fréquence et préparés en tenant compte du modèle de perception auditive humaine.

Dans Lyra V2, un nouveau modèle génératif basé sur le réseau neuronal convolutif SoundStream a été utilisé, se caractérisant par de faibles exigences en ressources computationnelles, ce qui permet un décodage en temps réel même sur des systèmes peu puissants. Le modèle utilisé pour la génération sonore a été formé en utilisant plusieurs milliers d'heures d'enregistrements vocaux dans plus de 90 langues. Pour faire fonctionner le modèle, TensorFlow Lite est utilisé. Les performances de l'implémentation proposée sont suffisantes pour encoder et décoder la parole sur des smartphones d'entrée de gamme.

En plus de l'utilisation d'un autre modèle génératif, la nouvelle version se distingue également par l'intégration dans l'architecture du codec de l'élément de quantification RVQ (Residual Vector Quantizer), effectué du côté de l'expéditeur avant la transmission des données, et du côté du récepteur après la réception des données. Le quantificateur transforme les paramètres fournis par le codec en ensembles de paquets, en codant les informations en fonction du bitrate choisi. Pour assurer différents niveaux de qualité, des quantificateurs sont prévus pour trois bitrates (3,2 kps, 6 kbps et 9,2 kbps), plus le bitrate est élevé, meilleure est la qualité, mais plus les exigences en bande passante augmentent.

Google a publié le code audio open source Lyra V2

La nouvelle architecture a permis de réduire la latence de transmission du signal de 100 à 20 millisecondes. À titre de comparaison, le codec Opus pour WebRTC a montré lors des tests de bitrate des latences de 26,5 ms, 46,5 ms et 66,5 ms. De plus, la performance de l'encodeur et du décodeur a considérablement augmenté — par rapport à la version précédente, une accélération allant jusqu'à 5 fois a été observée. Par exemple, sur le smartphone Pixel 6 Pro, le nouveau codec encode et décode un échantillon de 20 millisecondes en 0,57 ms, ce qui est 35 fois plus rapide que ce qui est nécessaire pour une transmission en temps réel.

En plus des performances, une amélioration de la qualité de restauration du son a également été atteinte — sur l'échelle MUSHRA, la qualité de la parole pour les bitrates de 3,2 kbps, 6 kbps et 9,2 kbps lors de l'utilisation du codec Lyra V2 correspond aux bitrates de 10 kbps, 13 kbps et 14 kbps avec le codec Opus.

Source : opennet.ru

Acheter un hébergement fiable pour les sites avec protection DDoS, serveurs VPS VDS 🔥 Acheter un hébergement fiable pour les sites avec protection DDoS, serveurs VPS VDS | ProHoster