Kompania Canonical prezantoi sistemin e njohjes së zërit Myna

Jean-Baptiste Lallement, drejtor i inxhinierisë në Canonical, prezantoi projektin Myna, i cili zhvillon një aplikacion për njohjen e fjalës, që do të përdoret për organizimin e inputit me zë dhe njohjen e komandave në gjuhën natyrore në Ubuntu Desktop. Projekti shpërndahet nën licencën GPLv3, por deri tani në repositori ka vetëm skica me përshkrimin e arkitekturës modulare të projektit dhe integrimin e tij me Ubuntu.

Për lëshimin e Ubuntu 26.10, aplikacioni planifikohet të jetë i aftë për inputin me zë të tekstit. Sesioni i punës me aplikacionin përfshin aktivizimin përmes një kombinimi të çelësave, diktimin me zë dhe ngjitjen e tekstit të njohur në aplikacionin aktual përmes simulimit të inputit nga tastiera gjatë të folurit. Gjatë aktivizimit të mikrofonit, do të shfaqet një tregues i veçantë në panel.
Si mjedisi bazë për testim do të jetë GNOME mbi Wayland, por aplikacioni është projektuar fillimisht për t'u adaptohej mjediseve të ndryshme të punës.

Për njohjen në Myna do të përdoret një model AI që ekzekutohet lokal. Midis kërkesave për aplikacionin janë: mundësia e funksionimit pa u lidhur në internet; aktivizimi i mikrofonit vetëm pas aktivizimit të qartë të modit të diktimit me një çelës të nxehtë; përpunimi i zërit në memorie, e cila pas çdo përdorimi duhet të pastrohet; ndalimi i dërgimit të regjistrimeve të zërit në shërbime të jashtme.

Komponentët për njohjen e zërit, ndërveprimin me përdoruesin, menaxhimin e diktimit dhe zëvendësimin e tekstit po zhvillohen në formën e moduleve.
Mjedisi për ekzekutimin e modeleve AI do të formohet në një paketa snap. Si modele të mundshme për njohjen përmenden Whisper, Parakeet, NemoTron dhe Qwen3-ASR.
Shërbimi i menaxhimit të diktimit ndjek shtypjen e çelësit të nxehtë, aktivizon mikrofonin, bën kërkesë përmes API-së te modeli AI në paketën snap, drejton fluxin e zërit nga shërbimi i zërit dhe koordinon fluxet e të dhënave.

Shërbimi i zërit i drejtohet pajisjes së zërit, si direkt, ashtu edhe përmes PulseAudio ose PipeWire, duke reduktuar zhurmën dhe duke rregulluar volumin. Teksti i gjeneruar nga modeli kalon në modulin e pastrimit për pastrim, normatizim, formatim dhe vendosjen e pikësimit. Teksti përfundimtar integret në aplikacion përmes zëvendësimit të inputit, për shembull, përmes protokollit input-method të Wayland ose IBus. hostingut Pas stabilizimit të funksionaliteteve fillestare, nuk përjashtohet realizimi i mundësive të tilla si funksionimi si asistent zëdhënësi, ekzekutimi i komandave me zë, kontrolli me zë i desktopit dhe përkthimi i tekstit të diktuar me njohjen automatikisht të gjuhës.

Jean-Baptiste Lallement, drejtor i inxhinierisë në Canonical, prezantoi projektin Myna, i cili zhvillon një aplikacion për njohjen e fjalës, që do të përdoret për organizimin e inputit me zë dhe njohjen e komandave në gjuhën natyrore në Ubuntu Desktop. Projekti shpërndahet nën licencën GPLv3, por deri tani në repositori ka vetëm skica me përshkrimin e arkitekturës modulare të projektit dhe integrimin e tij me



Burimi: opennet.ru

Bleni hostim tĂ« besueshĂ«m pĂ«r faqe me mbrojtje nga DDoS, serverĂ« VPS VDS đŸ”„ Bleni hostim tĂ« besueshĂ«m pĂ«r faqe me mbrojtje nga DDoS, serverĂ« VPS VDS | ProHoster