Nowe modele do rozpoznawania rosyjskiej mowy w bibliotece Vosk

Deweloperzy biblioteki Vosk opublikowali nowe modele do rozpoznawania mowy w języku rosyjskim: model serwerowy vosk-model-ru-0.22 oraz model mobilny Vosk-model-small-ru-0.22. W modelach zastosowano nowe dane głosowe oraz nową architekturę sieci neuronowej, co pozwoliło zwiększyć dokładność rozpoznawania o 10-20%. Kod i dane są dystrybuowane na licencji Apache 2.0.

Ważne zmiany:

  • Nowe dane zebrane w głośnikach znacząco poprawiają rozpoznawanie komend głosowych wypowiadanych z pewnej odległości.
  • Nowy schemat ekstrakcji dźwięku znacznie poprawił dokładność rozpoznawania dla nagrań szerokopasmowych. Jednocześnie dokładność rozpoznawania w telefonii również uległa poprawie.
  • Pakiet do rozszerzania słownika umożliwia dostosowanie rozpoznawania skomplikowanych nagrań technicznych.

Dla uzyskania najlepszej dokładności zaleca się zaktualizowanie wersji Vosk do 0.3.32. Interesujące mogą być również nowe możliwości Vosk — integracje z Unity, Nativescript, Jigasi. Modele do rozpoznawania języków kazachskiego i ukraińskiego. Do pracy modelu serwerowego potrzebny jest nowoczesny procesor i 8 GB pamięci. Model mobilny może być używany w telefonach oraz RaspberryPi 3+.

Źródło: opennet.ru

Kup solidny hosting stron z ochroną przed DDoS, serwery VPS VDS 🔥 Kup solidny hosting stron z ochroną przed DDoS, serwery VPS VDS | ProHoster