Die Mozilla Corporation hat die Sprachverarbeitungs-Engine DeepSpeech 0.6 vorgestellt.

PrĂ€sentiert Die von Mozilla entwickelte Sprachverarbeitungs-Engine DeepSpeech 0.6, die die gleichnamige Architektur zur Spracherkennung umsetzt, vorgeschlagen von Forscherinnen und Forschern von Baidu. Die Implementierung ist in Python verfasst und nutzt die Maschinenlern-Plattform TensorFlow und wird unter der GPLv3-Lizenz bereitgestellt. ist unter der offenen Lizenz MPL 2.0 verfĂŒgbar. Die Nutzung ist unterstĂŒtzt auf Linux, Android, macOS und Windows. Die Leistung ist ausreichend, um die Engine auf LePotato-Boards, Raspberry Pi 3 und Raspberry Pi 4 zu verwenden.

Im Paket werden ebenfalls vorgeschlagene trainierte Modelle, Beispiele von Audiodateien und ein Toolset zur Erkennung ĂŒber die Kommandozeile bereitgestellt. FĂŒr die Integration der Spracherkennungsfunktion in eigene Anwendungen gibt es einsatzbereite Module fĂŒr Python, NodeJS, C++ und .NET (von Drittentwicklern wurden zusĂ€tzlich Module fĂŒr Rust und Go). Das fertige Modell ist nur fĂŒr die englische Sprache verfĂŒgbar, aber fĂŒr andere Sprachen kann die beigefĂŒgte Anleitung System eigenstĂ€ndig trainiert werden, indem Stimmdaten, die im Rahmen des Projekts Common Voice gesammelt wurden, verwendet werden.

DeepSpeech ist deutlich einfacher als traditionelle Systeme und bietet gleichzeitig eine höhere ErkennungsqualitÀt, selbst bei HintergrundgerÀuschen. In der Entwicklung werden keine herkömmlichen akustischen Modelle und Phonemkonzepte verwendet; stattdessen kommt ein gut optimiertes maschinelles Lernen auf Basis neuronaler Netze zum Einsatz, das die Notwendigkeit entfÀllt, separate Komponenten zur Modellierung verschiedener Abweichungen wie LÀrm, Echo und Sprachmerkmale zu entwickeln.

Die Kehrseite dieses Ansatzes ist, dass fĂŒr eine qualitativ hochwertige Spracherkennung und das Training des neuronalen Netzwerks die DeepSpeech-Engine eine große Menge heterogener Daten benötigt, die in realen Bedingungen von verschiedenen Stimmen und bei natĂŒrlichen GerĂ€uschen diktiert wurden.
Die Erfassung solcher Daten wird durch das von Mozilla ins Leben gerufene Projekt Common Voice, das einen geprĂŒften Datensatz mit 780 Stunden in Englisch, 325 Stunden in Deutsch, 173 Stunden in Französisch und 27 Stunden in Russisch bereitstellt.

Das Endziel des Common Voice-Projekts ist es, 10.000 Stunden mit Aufnahmen unterschiedlicher Aussprachen typischer SĂ€tze der menschlichen Sprache zu sammeln, um ein akzeptables Fehlerniveau bei der Spracherkennung zu erreichen. Derzeit haben die Projektteilnehmer bereits insgesamt 4.300 Stunden diktiert, von denen 3.500 Stunden validiert wurden. Bei der Schulung des finalen englischen Modells fĂŒr DeepSpeech wurden 3.816 Stunden Sprache verwendet, zusĂ€tzlich zu Common Voice, die Daten aus den Projekten LibriSpeech, Fisher und Switchboard umfassen sowie etwa 1.700 Stunden transkribierter Aufnahmen von Radioshows.

Bei Verwendung des zum Download angebotenen fertigen englischen Modells liegt die Fehlerquote der Spracherkennung in DeepSpeech bei 7,5 % im Testset. LibriSpeech. Zum Vergleich liegt die Fehlerquote bei der menschlichen Spracherkennung bei 5,83%.

DeepSpeech besteht aus zwei Subsystemen – einem akustischen Modell und einem Decoder. Das akustische Modell nutzt Methoden des tiefen maschinellen Lernens zur Berechnung der Wahrscheinlichkeit bestimmter Zeichen im Eingangssignal. Der Decoder verwendet einen Suchalgorithmus, um die Wahrscheinlichkeitsdaten der Zeichen in ein Textformat umzuwandeln.

Haupt Neuheiten DeepSpeech 0.6 (die 0.6-Version ist nicht mit frĂŒheren Releases kompatibel und erfordert ein Update des Codes und der Modelle):

  • Ein neuer Streaming-Decoder wurde vorgeschlagen, der eine höhere ReaktionsfĂ€higkeit bietet und nicht von der GrĂ¶ĂŸe der verarbeiteten Audio-Daten abhĂ€ngt. Infolgedessen konnte die Verzögerung bei der Spracherkennung in der neuen Version von DeepSpeech auf 260 ms gesenkt werden, was 73 % schneller ist als zuvor und die Anwendung von DeepSpeech in Echtzeitanwendungen zur Spracherkennung ermöglicht.
  • Änderungen an der API wurden vorgenommen, und es wurde an der Vereinheitlichung der Funktionsnamen gearbeitet. Funktionen zum Abrufen zusĂ€tzlicher Metadaten zur Synchronisierung wurden hinzugefĂŒgt, die es ermöglichen, nicht nur eine textliche Ausgabe zu erhalten, sondern auch die Zuordnung einzelner Zeichen und SĂ€tze zu Positionen im Audiostream zu verfolgen.
  • Die Toolkit fĂŒr das Training von Modulen hat die UnterstĂŒtzung fĂŒr die Verwendung der Bibliothek hinzugefĂŒgt. CuDNN zur Optimierung der Arbeit mit rekurrenten neuronalen Netzen (RNN) wurde eine signifikante (ungefĂ€hr doppelte) Steigerung der Trainingsleistung des Modells erreicht, was jedoch Änderungen im Code erforderte, die die KompatibilitĂ€t mit zuvor vorbereiteten Modellen beeintrĂ€chtigen.
  • Die minimalen Anforderungen an die TensorFlow-Version wurden von 1.13.1 auf 1.14.0 angehoben. Die UnterstĂŒtzung der leichtgewichtigen Version TensorFlow Lite wurde hinzugefĂŒgt, wodurch die PaketgrĂ¶ĂŸe von DeepSpeech von 98 MB auf 3,7 MB reduziert wurde. FĂŒr den Einsatz auf eingebetteten und mobilen GerĂ€ten wurde die GrĂ¶ĂŸe der gepackten Datei mit dem Modell ebenfalls von 188 MB auf 47 MB reduziert (zur Kompression wurde das Verfahren der Quantisierung nach Abschluss des Modelltrainings verwendet).
  • Das Sprachmodell wurde in ein anderes Datenstrukturformat umgewandelt, das die Zuordnung von Dateien beim Laden im Speicher ermöglicht. Die UnterstĂŒtzung des alten Formats wurde eingestellt.
  • Der Lade-Modus der Sprachmodell-Datei wurde geĂ€ndert, um den Speicherverbrauch zu reduzieren und die Verzögerungen bei der Verarbeitung der ersten Anfrage nach Erstellung des Modells zu verringern. DeepSpeech benötigt nun wĂ€hrend der Laufzeit 22-mal weniger Speicher und startet 500-mal schneller.

    Die Mozilla Corporation hat die Sprachverarbeitungs-Engine DeepSpeech 0.6 vorgestellt.
  • Seltene Wörter wurden im Sprachmodell gefiltert. Die Gesamtzahl der Wörter wurde auf 500.000 der am hĂ€ufigsten vorkommenden Wörter im Trainingstext reduziert. Diese Bereinigung hat die GrĂ¶ĂŸe des Sprachmodells von 1800 MB auf 900 MB verringert, ohne die Erkennungsfehlerquote merklich zu beeinflussen.
  • UnterstĂŒtzung fĂŒr verschiedene Techniken zur Erstellung zusĂ€tzlicher Variationen (Augmentation) von Audiomaterial, das beim Training verwendet wird, wurde hinzugefĂŒgt (z. B. das HinzufĂŒgen von Varianten mit Verzerrungen oder Rauschen).
  • Eine Bibliothek mit Bindings zur Integration in Anwendungen auf der .NET-Plattform wurde hinzugefĂŒgt.
  • Die Dokumentation wurde ĂŒberarbeitet und ist jetzt auf einer separaten Website verfĂŒgbar deepspeech.readthedocs.io.

Quelle: opennet.ru

Erwerben Sie zuverlĂ€ssiges Hosting fĂŒr Websites mit DDoS-Schutz, VPS VDS-Server đŸ”„ Kaufen Sie zuverlĂ€ssiges Hosting fĂŒr Websites mit DDoS-Schutz, VPS VDS-Server | ProHoster