Neue Modelle zur Erkennung der russischen Sprache in der Vosk-Bibliothek

Die Entwickler der Vosk-Bibliothek haben neue Modelle zur Spracherkennung des Russischen veröffentlicht: das Server-Modell vosk-model-ru-0.22 und das mobile Modell Vosk-model-small-ru-0.22. In den Modellen werden neue Sprachdaten sowie eine neue neuronale Netzwerkarchitektur verwendet, was die Erkennungsgenauigkeit um 10-20% verbessert hat. Code und Daten werden unter der Apache 2.0-Lizenz veröffentlicht.

Wichtige Änderungen:

  • Neue Daten, die in Sprachlautsprechern gesammelt wurden, verbessern die Erkennung von Sprachbefehlen erheblich, die aus der Entfernung ausgesprochen werden.
  • Ein neues Audextraktionsschema hat die Erkennungsgenauigkeit fĂŒr Breitbandaufnahmen erheblich verbessert. Gleichzeitig hat sich auch die Erkennungsgenauigkeit fĂŒr Telefonie verbessert.
  • Das Paket zur ErgĂ€nzung des Wörterbuchs ermöglicht es, die Erkennung komplexer technischer Aufzeichnungen anzupassen.

FĂŒr die beste Genauigkeit wird empfohlen, auch die Vosk-Version auf 0.3.32 zu aktualisieren. Zudem könnten die neuen Möglichkeiten von Vosk interessant sein – Integrationen mit Unity, Nativescript, Jigasi. Modelle zur Erkennung der kasachischen und ukrainischen Sprachen. FĂŒr das Server-Modell wird ein moderner Prozessor und 8 GB RAM benötigt. Das mobile Modell kann in Telefonen und Raspberry Pi 3+ verwendet werden.

Quelle: opennet.ru

60GB SSD 8Gb DDR4