Nouvelle version du système de synthèse vocale Silero

Une nouvelle version publique du système de synthèse vocale par intelligence artificielle Silero Text-to-Speech est disponible. Le projet vise avant tout à créer un système de synthèse vocale moderne et de haute qualité, rivalisant avec les solutions commerciales des grandes entreprises et accessible à tous sans avoir besoin d'un matériel serveur coûteux.

Les modèles sont distribués sous la licence GNU AGPL, mais l'entreprise qui développe le projet ne divulgue pas le mécanisme d'entraînement des modèles. PyTorch et les frameworks prenant en charge le format ONNX peuvent être utilisés pour le déploiement. La synthèse vocale dans Silero repose sur des algorithmes neuronaux profondément modifiés et des méthodes de traitement numérique des signaux.

Il est à noter que le principal problème des solutions neuronales modernes pour la synthèse vocale est qu'elles sont souvent disponibles uniquement dans le cadre de solutions cloud payantes, tandis que les produits publics ont des exigences élevées en matière de matériel, une qualité inférieure ou ne sont pas des produits achevés et prêts à l'emploi. Par exemple, pour le fonctionnement sans problème de certaines des nouvelles architectures de synthèse end-to-end populaires, VITS, en mode de synthèse (c'est-à-dire pas pour l'entraînement des modèles), des cartes graphiques de plus de 16 Go de VRAM sont requises.

Contrairement à la tendance actuelle, les solutions Silero fonctionnent avec succès même sur un seul thread de processeur Intel x86 avec les instructions AVX2. Sur 4 threads de processeur, la synthèse permet de synthétiser de 30 à 60 secondes par seconde en mode 8 kHz, de 15 à 20 secondes en mode 24 kHz, et environ 10 secondes en mode 48 kHz.

Les principales caractéristiques de la nouvelle version de Silero :

  • La taille du modèle a été réduite de moitié à 50 mégaoctets ;
  • Les modèles savent faire des pauses ;
  • Quatre voix de haute qualité sont disponibles en russe (et un nombre infini de voix aléatoires). Exemples de prononciation ;
  • Les modèles sont dix fois plus rapides et, par exemple, en mode 24 kHz, permettent de synthétiser jusqu'à 20 secondes d'audio à la seconde sur 4 threads de processeur ;
  • Toutes les variantes de voix pour une langue particulière sont regroupées dans un seul modèle ;
  • Les modèles peuvent accepter des paragraphes complets de texte en entrée, et les balises SSML sont prises en charge ;
  • La synthèse fonctionne immédiatement à trois fréquences d'échantillonnage au choix : 8, 24 et 48 kilohertz ;
  • Les "problèmes d'enfance" ont été résolus : instabilité et omission de mots ;
  • Des indicateurs ont été ajoutés pour contrôler l'insertion automatique des accents et l'usage de la lettre « ё ».

Actuellement, pour la toute dernière version de synthèse, 4 voix en russe sont disponibles publiquement, mais dans un avenir proche, la prochaine version sera publiée avec les modifications suivantes :

  • La vitesse de synthèse augmentera de 2 à 4 fois ;
  • Les modèles de synthèse pour les langues de la CEI seront mis à jour : kalmouk, tatar, ouzbek et ukrainien ;
  • Des modèles pour les langues européennes seront ajoutés ;
  • Des modèles pour les langues indiennes seront ajoutés ;
  • Des modèles pour la langue anglaise seront ajoutés.

Certains des problèmes systémiques associés à la synthèse Silero :

  • Contrairement aux solutions de synthèse plus traditionnelles, telles que RHVoice, la synthèse Silero n'a pas d'intégration avec SAPI, de clients faciles à installer et d'intégrations pour Windows et Android ;
  • La vitesse, bien que sans précédent pour ce type de solution, peut être insuffisante pour la synthèse en temps réel sur des processeurs faibles avec une haute qualité ;
  • La solution d'automatisation de la prosodie ne traite pas les homographes (mots comme zAmok et zamOk) et commet encore des erreurs, mais cette lacune sera corrigée dans de futures versions ;
  • La version actuelle de la synthèse ne fonctionne pas sur les processeurs sans instructions AVX2 (ou il est nécessaire de modifier spécifiquement les paramètres de PyTorch), car un des modules au sein du modèle est quantifié ;
  • La version actuelle de la synthèse a essentiellement pour seule dépendance PyTorch, toute la structure étant 'intégrée' dans le modèle et les paquets JIT. Les sources des modèles ne sont pas publiées, tout comme le code pour exécuter les modèles depuis des clients PyTorch pour d'autres langues ;
  • Libtorch, disponible pour les plateformes mobiles, est beaucoup plus lourd que l'environnement d'exécution ONNX, mais la version ONNX du modèle n'est pas encore fournie.

Source : opennet.ru

Acheter un hébergement fiable pour les sites avec protection DDoS, serveurs VPS VDS 🔥 Acheter un hébergement fiable pour les sites avec protection DDoS, serveurs VPS VDS | ProHoster