Mozilla entwickelt Werkzeuge zur Spracherkennung mit Whisperfile.

Die Firma Mozilla entwickelt das Spracherkennungstool Whisperfile, das eine unabhängige, hochleistungsfähige Implementierung des von der Organisation OpenAI entwickelten und veröffentlichten Whisper-Maschinenlernmodells umfasst. Das Tool basiert auf whisper.cpp, einer Implementierung des Whisper-Modells in C/C++, die von Georgi Gerganov (Autor von llama.cpp) erstellt wurde. Der Code ist in C++ geschrieben und wird unter der MIT-Lizenz vertrieben.

Whisperfile wird vom Mozilla Ocho-Team weiterentwickelt und ergänzt das Projekt llamafile, das für die Erstellung universeller ausführbarer Dateien zum Starten großer Maschinenlernsprachmodelle (LLM) gedacht ist. Ähnlich wie llamafile ermöglicht das Projekt whisperfile die Generierung einer ausführbaren Datei auf der Grundlage einer Modellparameterdatei im GGUF-Format, die auf verschiedenen Betriebssystemen auf AMD64- und ARM64-Hardware ausgeführt werden kann. Der kompilierte Code kann mit der Standard-C-Bibliothek Cosmopolitan verknüpft werden, die es ermöglicht, Anwendungs-Bundles zu erstellen, die unter Linux, FreeBSD, macOS, OpenBSD, NetBSD und Windows ausgeführt werden können.

Beim Ausführen der ausführbaren Datei wird eine Sprachdatei im WAV-, MP3-, OGG- oder FLAC-Format als Eingabeparameter übergeben, und der erkannte Text wird als Ausgabe gespeichert. In der Praxis kann das Projekt für Aufgaben wie die Generierung von Textuntertiteln für Videos, die Erstellung von Protokollen für Sprach- und Videoanrufe, die Umwandlung von aufgezeichneten Sprachmaterialien in Text und die Organisation der Spracherfassung verwendet werden. Mit Whisperfile können solche Aufgaben lokal erledigt werden, ohne auf externe Dienste zugreifen zu müssen.

Zusätzlich wird die Funktion eines HTTP-Servers unterstützt, der Anfragen zur Spracherkennung über eine Web-API verarbeitet. Zur Beschleunigung der Arbeit mit dem Modell können GPUs und AVX-Instruktionen eingesetzt werden. Das Werkzeug kann auch Vertrauenswerte ausgeben, die es ermöglichen, erkannte Wörter je nach Genauigkeit ihrer Bestimmung zu färben.

Mozilla entwickelt Werkzeuge zur Spracherkennung mit Whisperfile.

Das verwendete Whisper-Modell wurde auf 680.000 Stunden Sprachdaten trainiert, die verschiedene Themenbereiche und Sprachen abdecken (2/3 der Daten sind in englischer Sprache). Das Modell ist gut in der Lage, Akzentsprachkenntnisse zu erkennen, versteht technischen Jargon, unterstützt die automatisierte Spracherkennung und funktioniert auch bei Hintergrundgeräuschen. Für Englisch zeigt das System eine Zuverlässigkeit und Genauigkeit der automatischen Spracherkennung, die der menschlichen Erkennung sehr nahekommt. Neben der Transkription von Sprache in Text kann das Modell auch für die Übersetzung von Sprache in eine andere Sprache verwendet werden.

Quelle: opennet.ru

Kaufen Sie zuverlässiges Hosting für Websites mit DDoS-Schutz, VPS VDS-Servern 🔥 Kaufen Sie zuverlässiges Hosting für Websites mit DDoS-Schutz, VPS VDS-Servern | ProHoster