Modele noi pentru recunoașterea vorbirii în limba rusă în biblioteca Vosk

Dezvoltatorii bibliotecii Vosk au publicat noi modele pentru recunoașterea vorbirii în limba rusă: modelul server vosk-model-ru-0.22 și modelul mobil Vosk-model-small-ru-0.22. Modelele folosesc date sonore noi, precum și o nouă arhitectură rețea neurală, ceea ce a permis creșterea preciziei de recunoaștere cu 10-20%. Codul și datele sunt distribuite sub licența Apache 2.0.

Modificări importante:

  • Noile date, colectate din difuzoarele vocale, îmbunătățesc semnificativ recunoașterea comenzilor vocale rostite de la distanță.
  • Noua schemă de extragere a sunetului a îmbunătățit considerabil precizia recunoașterii pentru înregistrările cu lățime de bandă largă. În același timp, precizia recunoașterii în telefonie s-a îmbunătățit de asemenea.
  • Pachetul pentru completarea vocabularului permite ajustarea recunoașterii înregistrărilor tehnice complexe.

Pentru cea mai bună precizie, se recomandă actualizarea versiunii Vosk la 0.3.32. De asemenea, pot fi de interes noile funcționalități ale Vosk – integrarea cu Unity, Nativescript, Jigasi. Modele pentru recunoașterea limbilor kazahă și ucraineană. Modelul server pentru funcționare necesită o procesor modern și 8GB de memorie. Modelul mobil poate fi utilizat în telefoane și RaspberryPi 3+.

Sursa: opennet.ro

Cumpără un hosting fiabil pentru site-uri cu protecție DDoS, servere VPS VDS 🔥 Cumpără un hosting fiabil pentru site-uri cu protecție DDoS, servere VPS VDS | ProHoster