Deweloperzy biblioteki Vosk opublikowali nowe modele do rozpoznawania mowy w języku rosyjskim: model serwerowy vosk-model-ru-0.22 oraz model mobilny Vosk-model-small-ru-0.22. W modelach zastosowano nowe dane głosowe oraz nową architekturę sieci neuronowej, co pozwoliło zwiększyć dokładność rozpoznawania o 10-20%. Kod i dane są dystrybuowane na licencji Apache 2.0.
Ważne zmiany:
- Nowe dane zebrane w głośnikach znacząco poprawiają rozpoznawanie komend głosowych wypowiadanych z pewnej odległości.
- Nowy schemat ekstrakcji dźwięku znacznie poprawił dokładność rozpoznawania dla nagrań szerokopasmowych. Jednocześnie dokładność rozpoznawania w telefonii również uległa poprawie.
- Pakiet do rozszerzania słownika umożliwia dostosowanie rozpoznawania skomplikowanych nagrań technicznych.
Dla uzyskania najlepszej dokładności zaleca się zaktualizowanie wersji Vosk do 0.3.32. Interesujące mogą być również nowe możliwości Vosk — integracje z Unity, Nativescript, Jigasi. Modele do rozpoznawania języków kazachskiego i ukraińskiego. Do pracy modelu serwerowego potrzebny jest nowoczesny procesor i 8 GB pamięci. Model mobilny może być używany w telefonach oraz RaspberryPi 3+.
Źródło: opennet.ru
