Mozilla dezvoltă instrumentarul pentru recunoașterea vocală Whisperfile

Compania Mozilla dezvoltă instrumentul de recunoaștere a vocii Whisperfile, care include o implementare independentă și de înaltă performanță a modelului de învățare automată Whisper, dezvoltat și deschis de organizația OpenAI. Instrumentul este construit pe baza whisper.cpp, o implementare a modelului Whisper în C/C++, creată de Georgi Gerganov (autorul llama.cpp). Codul este scris în C++ și este distribuit sub licența MIT.

Whisperfile este dezvoltat de echipa Mozilla Ocho și completează proiectul llamafile, destinat creării de fișiere executabile universale pentru rularea modelelor mari de limbaj de învățare automată (LLM). La fel ca llamafile, proiectul whisperfile permite generarea unui fișier executabil pe baza unui fișier cu parametrii modelului de învățare automată în format GGUF, care poate fi rulat pe diferite sisteme de operare pe echipamente cu procesoare AMD64 și ARM64. Codul compilat poate fi legat de biblioteca standard C Cosmopolitan, permițând crearea de aplicații care rulează pe Linux, FreeBSD, macOS, OpenBSD, NetBSD și Windows.

Atunci când fișierul executabil este lansat, fișierul cu sunetul vocii în format wav, mp3, ogg sau flac este transmis ca parametru de intrare, iar textul recunoscut este salvat la ieșire. Practic, proiectul poate fi utilizat pentru a genera subtitrări pentru videoclipuri, a crea un registru de apeluri vocale și video, a transforma materiale vocale înregistrate în text, și a organiza introducerea vocală. Cu ajutorul Whisperfile, astfel de sarcini pot fi realizate pe un sistem local fără a necesita servicii externe.

De asemenea, este suportată funcționarea ca server HTTP, care procesează solicitările de recunoaștere a vocii prin Web API. Pentru a accelera lucrul cu modelul, pot fi utilizate GPU-uri și instrucțiuni AVX. Instrumentul poate, de asemenea, să returneze coeficienți de încredere, permițând colorarea cuvintelor recunoscute în funcție de precizia determinării acestora.

Mozilla dezvoltă instrumentarul pentru recunoașterea vocală Whisperfile

Modelul Whisper utilizat a fost instruit pe 680.000 de ore de date vocale, acoperind diferite domenii și limbi (2/3 din date sunt în limba engleză). Modelul se descurcă bine cu recunoașterea vorbirii cu accent, identifică jargonul tehnic, suportă detectarea automată a limbii și poate funcționa în prezența zgomotului de fundal. Pentru vorbirea în limba engleză, sistemul demonstrează un nivel de fiabilitate și precizie a recunoașterii automate similar cu cel al recunoașterii umane. Pe lângă transcrierea vorbirii în text, modelul poate fi folosit și pentru traducerea vorbirii în alte limbi.

Sursa: opennet.ro

Cumpără un hosting fiabil pentru site-uri cu protecție DDoS, servere VPS VDS 🔥 Cumpără un hosting fiabil pentru site-uri cu protecție DDoS, servere VPS VDS | ProHoster