Gli sviluppatori della libreria Vosk hanno pubblicato nuovi modelli per il riconoscimento della lingua russa: il modello server vosk-model-ru-0.22 e il modello mobile Vosk-model-small-ru-0.22. Questi modelli utilizzano nuovi dati vocali e una nuova architettura di rete neurale, consentendo un aumento della precisione del riconoscimento del 10-20%. Il codice e i dati sono distribuiti sotto licenza Apache 2.0.
Modifiche importanti:
- I nuovi dati raccolti negli altoparlanti vocali migliorano notevolmente il riconoscimento dei comandi vocali pronunciati a distanza.
- Il nuovo schema di estrazione del suono ha migliorato significativamente la precisione del riconoscimento per le registrazioni a banda larga. Allo stesso tempo, anche la precisione del riconoscimento telefonico è migliorata.
- Il pacchetto per l'integrazione del vocabolario consente di personalizzare il riconoscimento di registrazioni tecniche complesse.
Per la massima precisione, si consiglia di aggiornare la versione di Vosk a 0.3.32. Potrebbero essere di interesse anche le nuove funzionalità di Vosk - integrazioni con Unity, Nativescript, Jigasi. Modelli per il riconoscimento delle lingue kazaka e ucraina. Per funzionare, il modello server richiede un processore moderno e 8 GB di memoria. Il modello mobile può essere utilizzato su telefoni e Raspberry Pi 3+.
Fonte: opennet.ru
