Les développeurs de la bibliothèque Vosk ont publié de nouveaux modèles pour la reconnaissance de la parole russe : le modèle serveur vosk-model-ru-0.22 et le modèle mobile Vosk-model-small-ru-0.22. Ces modèles utilisent de nouvelles données vocales ainsi qu'une nouvelle architecture de réseau neuronal, ce qui a permis d'augmenter la précision de la reconnaissance de 10 à 20 %. Le code et les données sont distribués sous la licence Apache 2.0.
Changements importants :
- De nouvelles données collectées à partir des haut-parleurs intelligents améliorent considérablement la reconnaissance des commandes vocales prononcées à distance.
- Un nouveau schéma d'extraction sonore a permis d'améliorer de manière significative la précision de la reconnaissance pour les enregistrements large bande. En même temps, la précision de la reconnaissance téléphonique s'est également améliorée.
- Le package pour l'ajout de vocabulaire permet d'ajuster la reconnaissance d'enregistrements techniques complexes.
Pour une précision optimale, il est recommandé de mettre à jour la version de Vosk à 0.3.32. De nouvelles fonctionnalités de Vosk peuvent également être intéressantes - intégrations avec Unity, Nativescript, Jigasi. Modèles pour la reconnaissance des langues kazakh et ukrainienne. Pour faire fonctionner le modèle serveur, il faut un processeur moderne et 8 Go de mémoire. Le modèle mobile peut être utilisé sur des téléphones et des Raspberry Pi 3+.
Source : opennet.ru
