Mozilla sviluppa lo strumento di riconoscimento vocale Whisperfile

Mozilla sta sviluppando uno strumento di riconoscimento vocale chiamato Whisperfile, che include un'implementazione indipendente e ad alte prestazioni del modello di machine learning Whisper, progettato e aperto dall'organizzazione OpenAI. Lo strumento si basa su whisper.cpp, l'implementazione del modello Whisper in C/C++, creata da Georgi Gerganov (autore di llama.cpp). Il codice è scritto in C++ e distribuito con licenza MIT.

Whisperfile è sviluppato dal team Mozilla Ocho e integra il progetto llamafile, destinato alla creazione di file eseguibili universali per l'esecuzione di grandi modelli di linguaggio di machine learning (LLM). Analogamente a llamafile, il progetto whisperfile consente di generare un file eseguibile a partire da un file con i parametri del modello di machine learning in formato GGUF, che può essere eseguito su vari sistemi operativi su hardware con processori AMD64 e ARM64. Il codice compilato può collegarsi con la libreria standard C Cosmopolitan, che consente la creazione di build di applicazioni eseguibili su Linux, FreeBSD, macOS, OpenBSD, NetBSD e Windows.

Quando si avvia un file eseguibile, si passa come parametro di input un file audio con voce in formato wav, mp3, ogg o flac, e come output viene salvato il testo riconosciuto. Nella pratica, il progetto può essere utilizzato per risolvere compiti come la generazione di sottotitoli per video, la creazione di log per chiamate vocali e video, la conversione di materiali vocali registrati in testo, e l'organizzazione dell'input vocale. Con Whisperfile, tali compiti possono essere eseguiti su un sistema locale senza ricorrere a servizi esterni.

In aggiunta, è supportato il funzionamento come server HTTP, che gestisce le richieste di riconoscimento vocale tramite Web API. Per accelerare le prestazioni del modello, possono essere utilizzati GPU e istruzioni AVX. L'utensile può anche fornire coefficienti di affidabilità, consentendo di colorare le parole riconosciute in base alla loro precisione di identificazione.

Mozilla sviluppa lo strumento di riconoscimento vocale Whisperfile

Il modello Whisper utilizzato è stato addestrato su 680.000 ore di dati vocali che coprono diverse aree tematiche e lingue (2/3 dei dati sono in inglese). Il modello gestisce bene il riconoscimento vocale con accenti, identifica il gergo tecnico, sostiene l'automazione nel riconoscimento della lingua e può funzionare anche in presenza di rumore di fondo. Per la voce in inglese, il sistema mostra un livello di affidabilità e precisione del riconoscimento automatico simile a quello del riconoscimento umano. Oltre alla trascrizione del parlato in testo, il modello può essere utilizzato anche per la traduzione del parlato in un'altra lingua.

Fonte: opennet.ru

Acquista un hosting affidabile per siti con protezione DDoS, server VPS VDS 🔥 Acquista un hosting affidabile per siti con protezione DDoS, server VPS VDS | ProHoster