Kompania Mozilla po zhvillon instrumentin e njohjes së zërit Whisperfile, i cili përfshin një implementim të pavarur me performancë të lartë të modelit të mësimit automatik Whisper, i zhvilluar dhe i hapur nga organizata OpenAI. Instrumenti është krijuar mbi whisper.cpp, një implementim i modelit Whisper në C/C++, i krijuar nga Georgi Gerganov (autori i llama.cpp). Kodi është shkruar në C++ dhe shpërndahet nën licencën MIT.
Whisperfile po zhvillohet nga ekipi Mozilla Ocho dhe plotëson projektin llamafile, i cili është i destinuar për krijimin e skedave universale ekzekutues për të ekzekutuar modelet e mëdha të mësimit automatik (LLM). Siç është me llamafile, projekti whisperfile lejon që në bazë të një skedari me parametrat e modelit të mësimit automatik në formatin GGUF të gjenerohet një skedar ekzekutues, i cili mund të ekzekutohet në sisteme të ndryshme operative në pajisje me procesorë AMD64 dhe ARM64. Kodi i kompiluar mund të lidhet me bibliotekën standarde të C-së Cosmopolitan, e cila lejon krijimin e ndërtimeve të aplikacioneve që ekzekutohen në Linux, FreeBSD, macOS, OpenBSD, NetBSD dhe Windows.
Kur niset skedari ekzekutues, si parameter hyrës dërgohet një skedar me zë në format wav, mp3, ogg ose flac, dhe në dalje ruhet teksti i njohur. Në praktikë, projekti mund të përdoret për të zgjidhur detyra të tilla si gjenerimi i titrave tekstualë për video, krijimi i një logu të thirrjeve vokale dhe video, konvertimi i materialeve vokale të regjistruara në tekst, organizimi i hyrjes vokale. Me ndihmën e Whisperfile, këto detyra mund të zgjidhen në sistemin lokal pa iu drejtuar shërbimeve të jashtme.
Për më tepër, mbështetet funksionimi si një server HTTP, duke përpunuar kërkesat për njohjen e zërit përmes Web API. Për të përshpejtuar punën me modelin, mund të angazhohen GPU dhe instruktime AVX. Instrumenti gjithashtu mund të nxjerrë koeficientë besueshmërie, të cilët lejojnë që fjalët e njohura të përngjashmërohen në varësi të saktësisë së përcaktimit të tyre.

Modeli i përdorur Whisper është stërvitur në 680 mijë orë të dhënash vokale, të cilat përfshijnë fusha të ndryshme tematike dhe gjuhë (2/3 e të dhënave janë në anglisht). Modeli përballohet mirë me njohjen e zërit me akcent, përcakton zhargonin teknik, mbështet përcaktimin automatik të gjuhës dhe mund të funksionojë nën kushte zhurme të sfondit. Për zërin në gjuhën angleze, sistemi tregon një nivel të besueshmërisë dhe saktësisë së njohjes automatike që është afër njohjes nga njeriu. Përveç transkriptimeve të zërit në tekst, modeli gjithashtu mund të përdoret për përkthimin e zërit në një gjuhë tjetër.
Burimi: opennet.ru
