Canonical on esitle nud kõnetuvastuse süsteemi Myna.

Jean Baptiste Lallement, Canonicali inseneritegevuse juht, tutvustas projekti Myna, mis arendab kõnetuvastuse rakendust, mida plaanitakse kasutada hääle sisestamise ja loomuliku keele käsu tuvastamise korraldamiseks Ubuntu Desktopis. Projekt levitatakse GPLv3 litsentsi alusel, kuid hoidlates on seni vaid visandid, mis kirjeldavad projekti modulaarset arhitektuuri ja selle integreerimist Ubuntu süsteemiga.

Ubuntu 26.10 väljaande jaoks plaanitakse rakendust viia sobivaks häälesisestamiseks. Rakenduse kasutamise seanss koosneb klahvikombinatsiooniga aktiveerimisest, häälega dikteerimisest ja tuvastatud teksti sisestamisest aktiivsesse rakendusse klaviatuuri sisestamise simuleerimise kaudu selle väljendamise ajal. Mikrofoni aktiveerimisel kuvatakse paneelis spetsiaalne indikaator.
Põhikatsetamiseks on välja kuulutatud GNOME, mis töötab Waylandi põhjal, kuid rakendus projekteeritakse algselt võimalusena kohandada seda erinevatele töölaudade keskkondadele.

Myna kõnetuvastamiseks kasutatakse AI mudelit, mis töötab lokaalselt. Rakendusele esitatavad nõuded sisaldavad: töövõime ilma internetiühenduseta; mikrofoni aktiveerimine ainult pärast sooviavalduse klahvi selget aktiveerimist; heli töötlemine mälus, mis puhastatakse pärast igat kasutust; salvestuste edastamise keeld välistesse teenustesse.

Kõnetuvastuse, kasutajaga suhtlemise, dikteerimise haldamise ja teksti sisestamise komponendid arendatakse moodulitena.
AI mudelite töökeskkond vormistatakse snap-paketina. Tuvastamiseks mainitakse võimalikke mudeleid nagu Whisper, Parakeet, NemoTron ja Qwen3-ASR.
Dikteerimisõiguse haldamise teenus jälgib kuumklahvi vajutusi, aktiveerib mikrofoni, pöördub API kaudu snap-paketis oleva AI mudeli poole, edastab sellele helivooge ja koordineerib andmevooge.

Heliteenus pöördub heliseadmestikku nii otse kui ka läbi PulseAudio või PipeWire, jättes kõrvalhelid ja tasakaalustades helitugevust. Mudelilt saadud tekst edastatakse postitöötluse moodulisse, et puhastada, normaliseerida, vormindada ja lisada kirjavahemärke. Lõplik tekst sisestatakse rakendusse sisendi simuleerimise teel, näiteks Waylandi protokolli input-method või IBusi kaudu. serverid Pärast algsete funktsioonide stabiliseerimist ei välistata selliste võimaluste rakendamist nagu tegutsemine häälassistentina, häälkäskude täitmine, lauaarvuti häälkontroll ja dikteeritud teksti automaatne keele tuvastamisega tõlkimine.

Jean Baptiste Lallement, Canonicali inseneritegevuse juht, tutvustas projekti Myna, mis arendab kõnetuvastuse rakendust, mida plaanitakse kasutada häälesisestamise ja loomuliku keele käsu tuvastamise korraldamiseks Ubuntu Desktopis. Projekt levitatakse GPLv3 litsentsi alusel, kuid hoidlates on seni vaid visandid, mis kirjeldavad projekti modulaarset arhitektuuri ja selle integreerimist.



Allikas: opennet.ru

Osta usaldusväärne veebihosting DDoS kaitsega, VPS VDS serverid 🔥 Osta usaldusväärne veebihosting DDoS kaitsega, VPS VDS serverid | ProHoster