Gli sviluppatori della libreria Vosk hanno pubblicato nuovi modelli per il riconoscimento della lingua russa: il modello server vosk-model-ru-0.22 e il modello mobile Vosk-model-small-ru-0.22. I modelli utilizzano nuovi dati vocali e una nuova architettura di rete neurale, il che ha permesso di aumentare la precisione del riconoscimento dal 10% al 20%. Il codice e i dati sono distribuiti sotto licenza Apache 2.0.
Modifiche importanti:
- I nuovi dati raccolti negli altoparlanti vocali migliorano notevolmente il riconoscimento dei comandi vocali pronunciati da una certa distanza.
- Il nuovo schema di estrazione audio ha significativamente migliorato la precisione del riconoscimento per le registrazioni a banda larga. Allo stesso tempo, la precisione del riconoscimento per la telefonia è anch'essa migliorata.
- Il pacchetto per l'integrazione del vocabolario consente di configurare il riconoscimento delle registrazioni tecniche complesse.
Per la migliore precisione si raccomanda di aggiornare anche la versione di Vosk a 0.3.32. Potrebbero essere interessanti anche le nuove funzionalità di Vosk - integrazioni con Unity, Nativescript, Jigasi. Modelli per il riconoscimento delle lingue kazaka e ucraina. È necessario per il modello server un processore moderno e 8 GB di memoria. Il modello mobile può essere utilizzato su telefoni e Raspberry Pi 3+.
Fonte: opennet.ru
