Nouveaux modèles pour la reconnaissance de la parole russe dans la bibliothèque Vosk

Les développeurs de la bibliothèque Vosk ont publié de nouveaux modèles pour la reconnaissance de la parole russe : le modèle serveur vosk-model-ru-0.22 et le modèle mobile Vosk-model-small-ru-0.22. Ces modèles utilisent de nouvelles données vocales ainsi qu'une nouvelle architecture de réseau neuronal, ce qui a permis d'augmenter la précision de la reconnaissance de 10 à 20 %. Le code et les données sont distribués sous la licence Apache 2.0.

Changements importants :

  • De nouvelles données collectées à partir des haut-parleurs intelligents améliorent considérablement la reconnaissance des commandes vocales prononcées à distance.
  • Un nouveau schéma d'extraction sonore a permis d'améliorer de manière significative la précision de la reconnaissance pour les enregistrements large bande. En même temps, la précision de la reconnaissance téléphonique s'est également améliorée.
  • Le package pour l'ajout de vocabulaire permet d'ajuster la reconnaissance d'enregistrements techniques complexes.

Pour une précision optimale, il est recommandé de mettre à jour la version de Vosk à 0.3.32. De nouvelles fonctionnalités de Vosk peuvent également être intéressantes - intégrations avec Unity, Nativescript, Jigasi. Modèles pour la reconnaissance des langues kazakh et ukrainienne. Pour faire fonctionner le modèle serveur, il faut un processeur moderne et 8 Go de mémoire. Le modèle mobile peut être utilisé sur des téléphones et des Raspberry Pi 3+.

Source : opennet.ru

Acheter un hébergement fiable pour les sites avec protection DDoS, serveurs VPS VDS 🔥 Acheter un hébergement fiable pour les sites avec protection DDoS, serveurs VPS VDS | ProHoster