Los desarrolladores de la biblioteca Vosk han publicado nuevos modelos para el reconocimiento del habla rusa: el modelo servidor vosk-model-ru-0.22 y el modelo móvil Vosk-model-small-ru-0.22. En los modelos se utilizan nuevos datos de habla, así como una nueva arquitectura de red neuronal, lo que ha permitido aumentar la precisión del reconocimiento en un 10-20%. El código y los datos se distribuyen bajo la licencia Apache 2.0.
Cambios importantes:
- Nuevos datos recopilados en altavoces inteligentes mejoran significativamente el reconocimiento de comandos de voz pronunciados desde la distancia.
- Esquema de extracción de sonido mejorado ha permitido aumentar considerablemente la precisión del reconocimiento para grabaciones de banda ancha. Al mismo tiempo, la precisión del reconocimiento telefónico también ha mejorado.
- El paquete para la ampliación del vocabulario permite personalizar el reconocimiento de grabaciones técnicas complejas.
Para la mejor precisión, se recomienda actualizar la versión de Vosk a 0.3.32. También pueden ser interesantes las nuevas funcionalidades de Vosk: integraciones con Unity, Nativescript, Jigasi. Modelos para el reconocimiento de los idiomas kazajo y ucraniano. Para la modelo servidor se necesita un procesador moderno y 8GB de memoria. El modelo móvil se puede utilizar en teléfonos y RaspberryPi 3+.
Fuente: opennet.ru
