Nuevos modelos para el reconocimiento del habla rusa en la biblioteca Vosk

Los desarrolladores de la biblioteca Vosk han publicado nuevos modelos para el reconocimiento del habla rusa: el modelo servidor vosk-model-ru-0.22 y el modelo móvil Vosk-model-small-ru-0.22. En los modelos se utilizan nuevos datos de habla, así como una nueva arquitectura de red neuronal, lo que ha permitido aumentar la precisión del reconocimiento en un 10-20%. El código y los datos se distribuyen bajo la licencia Apache 2.0.

Cambios importantes:

  • Nuevos datos recopilados en altavoces inteligentes mejoran significativamente el reconocimiento de comandos de voz pronunciados desde la distancia.
  • Esquema de extracción de sonido mejorado ha permitido aumentar considerablemente la precisión del reconocimiento para grabaciones de banda ancha. Al mismo tiempo, la precisión del reconocimiento telefónico también ha mejorado.
  • El paquete para la ampliación del vocabulario permite personalizar el reconocimiento de grabaciones técnicas complejas.

Para la mejor precisión, se recomienda actualizar la versión de Vosk a 0.3.32. También pueden ser interesantes las nuevas funcionalidades de Vosk: integraciones con Unity, Nativescript, Jigasi. Modelos para el reconocimiento de los idiomas kazajo y ucraniano. Para la modelo servidor se necesita un procesador moderno y 8GB de memoria. El modelo móvil se puede utilizar en teléfonos y RaspberryPi 3+.

Fuente: opennet.ru

Compra un hosting fiable para sitios web con protección contra DDoS, servidores VPS VDS 🔥 Compra un hosting fiable para sitios web con protección contra DDoS, servidores VPS VDS | ProHoster