La société Mozilla développe un ensemble d'outils de reconnaissance vocale nommé Whisperfile, qui inclut une implémentation indépendante et performante du modèle d'apprentissage automatique Whisper, conçu et rendu public par l'organisation OpenAI. Cet ensemble d'outils est basé sur whisper.cpp, l'implémentation du modèle Whisper en C/C++, créée par Georgy Gerganov (auteur de llama.cpp). Le code est écrit en C++ et est distribué sous la licence MIT.
Whisperfile est développé par l'équipe Mozilla Ocho et complète le projet llamafile, destiné à créer des fichiers exécutables universels pour exécuter de grands modèles de langage machine (LLM). De la même manière que llamafile, le projet whisperfile permet, à partir d'un fichier de paramètres du modèle d'apprentissage automatique au format GGUF, de générer un fichier exécutable qui peut être exécuté sur différents systèmes d'exploitation sur du matériel avec des processeurs AMD64 et ARM64. Le code compilé peut être lié à la bibliothèque C standard Cosmopolitan, permettant de créer des assemblages d'applications pouvant s'exécuter sous Linux, FreeBSD, macOS, OpenBSD, NetBSD et Windows.
Lors de l'exécution du fichier exécutable, un fichier audio contenant de la parole au format wav, mp3, ogg ou flac est passé en paramètre d'entrée, et le texte reconnu est sauvegardé en sortie. Dans la pratique, le projet peut être utilisé pour résoudre des problèmes tels que la génération de sous-titres pour des vidéos, la création de journaux d'appels vocaux et vidéo, la transformation de matériaux vocaux enregistrés en texte, ou l'organisation de saisies vocales. Grâce à Whisperfile, ces tâches peuvent être effectuées sur un système local sans avoir recours à des services externes.
En outre, le fonctionnement en tant que serveur HTTP est également pris en charge, traitant les requêtes de reconnaissance vocale via Web API. Pour accélérer le travail avec le modèle, des GPU et des instructions AVX peuvent être utilisés. L'ensemble d'outils peut également fournir des coefficients de confiance, permettant de colorer les mots reconnus en fonction de la précision de leur identification.

Le modèle Whisper utilisé a été entraîné sur 680 000 heures de données vocales couvrant divers domaines thématiques et langues (2/3 des données sont en anglais). Le modèle excelle dans la reconnaissance de la parole avec accent, identifie le jargon technique, prend en charge la détection automatique de la langue et peut fonctionner en présence de bruit de fond. Pour la parole anglaise, le système démontre un niveau de fiabilité et de précision de la reconnaissance automatique proche de celle de l'humain. Outre la transcription de la parole en texte, le modèle peut également être utilisé pour traduire la parole dans une autre langue.
Source : opennet.ru
