Mozilla sta sviluppando un toolkit per il riconoscimento vocale Whisperfile

L'azienda Mozilla sviluppa lo strumento di riconoscimento vocale Whisperfile, che include un'implementazione autonoma ad alte prestazioni del modello di machine learning Whisper, sviluppato e reso pubblico dall'organizzazione OpenAI. Lo strumento è basato su whisper.cpp, un'implementazione del modello Whisper in C/C++, creata da Georgy Gerganov (autore di llama.cpp). Il codice è scritto in C++ e distribuito sotto licenza MIT.

Whisperfile è sviluppato dal team di Mozilla Ocho e integra il progetto llamafile, progettato per creare file eseguibili universali per l'esecuzione di grandi modelli linguistici di machine learning (LLM). Analogamente a llamafile, il progetto whisperfile consente di generare un file eseguibile basato su un file di parametri del modello di machine learning in formato GGUF, che può essere eseguito su diversi sistemi operativi su hardware con processori AMD64 e ARM64. Il codice compilato può collegarsi alla libreria standard C Cosmopolitan, consentendo la creazione di applicazioni eseguibili su Linux, FreeBSD, macOS, OpenBSD, NetBSD e Windows.

All'avvio del file eseguibile, viene passato un file audio di input in formato wav, mp3, ogg o flac, e il testo riconosciuto viene salvato in output. Nella pratica, il progetto può essere utilizzato per risolvere compiti come la generazione di sottotitoli per video, la creazione di log di chiamate vocali e video, la trascrizione di materiali vocali registrati in testo, e l'organizzazione dell'immissione vocale. Con Whisperfile, tali compiti possono essere eseguiti su sistemi locali senza doversi affidare a servizi esterni.

Supporta inoltre il funzionamento come server HTTP, gestendo le richieste di riconoscimento vocale tramite Web API. Per velocizzare l'elaborazione con il modello, possono essere utilizzati GPU e istruzioni AVX. Lo strumento può anche fornire coefficienti di affidabilità, consentendo di colorare le parole riconosciute in base all'accuratezza della loro identificazione.

Mozilla sta sviluppando un toolkit per il riconoscimento vocale Whisperfile

Il modello Whisper utilizzato è stato addestrato su 680.000 ore di dati vocali, che coprono diverse aree tematiche e lingue (2/3 dei dati è in inglese). Il modello gestisce bene il riconoscimento vocale con accentuazioni, identifica il gergo tecnico, supporta il riconoscimento automatico della lingua e può funzionare anche in presenza di rumori di sottofondo. Per il parlato in inglese, il sistema dimostra un livello di affidabilità e accuratezza del riconoscimento vocale simile a quello umano. Oltre alla trascrizione del parlato in testo, il modello può essere utilizzato anche per la traduzione della voce in un'altra lingua.

Fonte: opennet.ru

Acquista hosting affidabile per siti web con protezione DDoS, VPS VDS server 🔥 Acquista hosting affidabile per siti web con protezione DDoS, VPS VDS server | ProHoster