Mozilla entwickelt Werkzeuge für die Spracherkennung Whisperfile.

Die Mozilla Corporation entwickelt das Sprachverarbeitungstool Whisperfile, das eine unabhängige, leistungsstarke Implementierung des von der Organisation OpenAI entwickelten und veröffentlichten Machine-Learning-Modells Whisper umfasst. Das Tool basiert auf whisper.cpp, einer Implementierung des Whisper-Modells in C/C++, die von Georgi Gerganov (Autor von llama.cpp) erstellt wurde. Der Code ist in C++ geschrieben und wird unter der MIT-Lizenz verbreitet.

Whisperfile wird vom Mozilla Ocho-Team weiterentwickelt und ergänzt das Projekt llamafile, das für die Erstellung universeller ausführbarer Dateien zum Starten großer Sprachmodelle des maschinellen Lernens (LLM) vorgesehen ist. Analog zu llamafile ermöglicht das Projekt whisperfile, auf Basis einer Modellparameterdatei im GGUF-Format eine ausführbare Datei zu generieren, die auf verschiedenen Betriebssystemen auf Hardware mit AMD64- und ARM64-Prozessoren ausgeführt werden kann. Der kompilierte Code kann mit der Standard-C-Bibliothek Cosmopolitan verknüpft werden, was die Erstellung von Anwendungs-Builds ermöglicht, die unter Linux, FreeBSD, macOS, OpenBSD, NetBSD und Windows ausgeführt werden können.

Bei der Ausführung der ausführbaren Datei wird als Eingabeparameter eine Audiodatei im WAV-, MP3-, OGG- oder FLAC-Format übergeben, und der erkannte Text wird als Ausgabe gespeichert. In der Praxis kann das Projekt für Aufgaben wie die Erstellung von Untertiteltexten für Videos, die Protokollierung von Sprach- und Videoanrufen, die Umwandlung aufgezeichneter Sprachmaterialien in Text und die Organisation der Sprachsteuerung verwendet werden. Mit Whisperfile können solche Aufgaben lokal ohne die Inanspruchnahme externer Dienste gelöst werden.

Zusätzlich wird der Betrieb als HTTP-Server unterstützt, der Anfragen zur Spracherkennung über Web-API verarbeitet. Zur Beschleunigung der Arbeit mit dem Modell können GPUs und AVX-Instruktionen eingesetzt werden. Das Tool kann auch Zuverlässigkeitskennzahlen ausgeben, mit denen erkannte Wörter je nach Genauigkeit ihrer Bestimmung hervorgehoben werden können.

Mozilla entwickelt Werkzeuge für die Spracherkennung Whisperfile.

Das verwendete Whisper-Modell wurde auf 680.000 Stunden Sprachdaten trainiert, die verschiedene Themen und Sprachen abdecken (2/3 der Daten sind in englischer Sprache). Das Modell bewältigt die Spracherkennung mit Akzent gut, erkennt technischen Jargon, unterstützt die automatische Spracherkennung und kann bei Hintergrundgeräuschen arbeiten. Bei der Spracherkennung in englischer Sprache zeigt das System eine Zuverlässigkeit und Genauigkeit, die der menschlichen Spracherkennung nahekommt. Neben der Transkription von Sprache zu Text kann das Modell auch für die Übersetzung von Sprache in eine andere Sprache eingesetzt werden.

Quelle: opennet.ru

60GB SSD 8Gb DDR4