Die Entwickler der Vosk-Bibliothek haben neue Modelle zur Spracherkennung des Russischen veröffentlicht: das Server-Modell vosk-model-ru-0.22 und das mobile Modell Vosk-model-small-ru-0.22. In den Modellen werden neue Sprachdaten sowie eine neue neuronale Netzwerkarchitektur verwendet, was die Erkennungsgenauigkeit um 10-20% verbessert hat. Code und Daten werden unter der Apache 2.0-Lizenz veröffentlicht.
Wichtige Ănderungen:
- Neue Daten, die in Sprachlautsprechern gesammelt wurden, verbessern die Erkennung von Sprachbefehlen erheblich, die aus der Entfernung ausgesprochen werden.
- Ein neues Audextraktionsschema hat die Erkennungsgenauigkeit fĂŒr Breitbandaufnahmen erheblich verbessert. Gleichzeitig hat sich auch die Erkennungsgenauigkeit fĂŒr Telefonie verbessert.
- Das Paket zur ErgÀnzung des Wörterbuchs ermöglicht es, die Erkennung komplexer technischer Aufzeichnungen anzupassen.
FĂŒr die beste Genauigkeit wird empfohlen, auch die Vosk-Version auf 0.3.32 zu aktualisieren. Zudem könnten die neuen Möglichkeiten von Vosk interessant sein â Integrationen mit Unity, Nativescript, Jigasi. Modelle zur Erkennung der kasachischen und ukrainischen Sprachen. FĂŒr das Server-Modell wird ein moderner Prozessor und 8 GB RAM benötigt. Das mobile Modell kann in Telefonen und Raspberry Pi 3+ verwendet werden.
Quelle: opennet.ru
