
Canonical ka paraqitur projektin Myna â njĂ« sistem tĂ« ri tĂ« shndĂ«rrimit tĂ« zĂ«rit nĂ« tekst pĂ«r Ubuntu Desktop. Projekti synon dictimin e integruar: pĂ«rdoruesi shtyp njĂ« tast tĂ« nxehtĂ«, flet, dhe teksti i njohur shfaqet nĂ« aplikacionin aktiv. NĂ« njoftim theksohet se Myna duhet tĂ« ndihet si njĂ« pjesĂ« natyrore e desktopit tĂ« Ubuntu dhe tĂ« funksionojĂ« me respekt pĂ«r privatĂ«sinĂ« e pĂ«rdoruesit. Lista e gjuhĂ«ve tĂ« mbĂ«shtetura pĂ«r hyrje nĂ« momentin e publikimit tĂ« lajmit nuk Ă«shtĂ« bĂ«rĂ« e njohur.
QĂ«llimi i parĂ« i projektit â Ubuntu 26.10. NĂ« kĂ«tĂ« fazĂ«, Canonical nuk pĂ«rpiqet tĂ« krijojĂ« njĂ« ndihmĂ«s zanor tĂ« plotĂ« ose njĂ« sistem kontrolli tĂ« desktopit me zĂ«. Zhvilluesit e kanĂ« kufizuar qĂ«llimisht fushĂ«n e versionit tĂ« parĂ« nĂ« dictimin thelbĂ«sor dhe tĂ« besueshĂ«m: shtypni kombinimin e çelĂ«sit, flisni tekstin dhe merrni rezultatin nĂ« fushĂ«n aktuale tĂ« hyrjes. Mjedisi i parĂ« i verifikueshĂ«m â Ubuntu Desktop nĂ« Wayland me GNOME, por arkitektura planifikon tĂ« mbetet mjaft e hapur pĂ«r mbĂ«shtetje tĂ« ardhshme tĂ« ambienteve tĂ« tjera.
Myna është e dizajnuar për njohjen lokale të të folurit. Pas instalimit të modeleve të nevojshme, nuk kërkohet lidhje interneti për të punuar me diktimin, mikrofonin duhet ta përdorë vetëm pas aktivizimit të qartë nga përdoruesi, audio përpunoset në memorje dhe pastaj hidhet, ndërsa regjistrimet nuk dërgohen në shërbime të jashtme. Në specifikimin e projektit gjithashtu përcaktohet se zgjidhja duhet të shmangë ruajtjen e audios si rregull dhe nuk duhet të kalojë papritur në një shërbim në re.
Kodi dhe dokumentacioni i Myna janë publikuar në depozitën Canonical në GitHub. Projekti përshkruhet si një aplikacion i lehtë speech-to-text për Ubuntu Desktop dhe shpërndahet nën licencën GPL-3.0. Ndërkohë, projekti është në fazën fillestare: në depozitë nuk ka ende versione të publikuara, dhe specifikimi arkitektonik ka statusin Proposed.
Funksionet kryesore dhe veçoritë e Myna
Diktimi Push-to-talk. Përdoruesi mban një buton të nxehtë të përshtatshëm, flet, dhe sistemi fut tekstin e njohur në fushën e zgjedhur për input. Diktimi përfundon pas lirimit të çelësit.
Njohje lokale e të folurit. Njohja bëhet në makinën e përdoruesit përmes një grumbulli inferencë lokal. Kjo zvogëlon varësinë nga shërbimet cloud dhe lejon punën pa rrjet pas instalimit të modeleve.
Përpunim privat të audios. Mikrofoni aktivizohet vetëm gjatë sesionit të përdoruesit të diktatës. Audio nuk duhet të regjistrohet në disk si rregull, përdoret një bufers i kufizuar në memory që pastron pas përfundimit të sesionit.
Tregues vizual aktiviteti. Gjatë regjistrimit dhe transkriptimit, përdoruesi duhet të shohë një tregues gjendjeje të qartë. Në specifikim përmenden gjendje si Regjistrimi, Transkriptimi, Finalizimi dhe Gabimi.
Futja e vetëm tekstit stabil. Në implementimin e parë, hipotezat e ndërmjetme të njohjes nuk duhet të vendosen direkt në aplikacion. Në fushën përfundimtare dërgohet vetëm teksti final të konfirmuar.
Pas pĂ«rpunimi i tekstit. Shkruarja e papĂ«rpunuar mund tĂ« kalojĂ« normalizimin, vendosjen e pikave, kapitalizimin, formatimin dhe transformimin e formave gojore nĂ« ato tĂ« shkruara, pĂ«r shembull, âtwenty twoâ â â22â.
Zgjedhja e gjuhës së diktatës. Sistemi duhet të mbështesë një gjuhë të personalizuar për diktim, duke u bazuar në mënyrë të parazgjedhur në gjuhën e ndërfaqes së përdoruesit, nëse një model i përshtatshëm është në dispozicion.
Profillet e cilësisë së modelit. Specifikimi përfshin profile të ndryshme modeli: një variant të lehtë me konsum më të vogël resursesh, një profil të balancuar si parazgjedhje dhe një variant më cilësor, por më të rëndë.
Punë e sigurt me fokusin e hyrjes. Qëllimi për futjen e tekstit zgjidhet në fillim të sesionit. Nëse fokusi i dritares ndryshon gjatë diktimit, sistemi nuk duhet ta dërgojë heshtazi tekstin në një aplikacion tjetër.
Bloakimi në fusha të mbrojtura. Diktimi duhet të bllokohet në fusha password, dritare autentifikimi dhe vende të tjera të mbrojtura, nëse aplikacioni ose grupi i veglave e lejon këtë të përcaktohet.
Integrimi me Wayland/GNOME. Versioni i parë fokusohet në Wayland dhe GNOME. Për futjen fillestare të tekstit shqyrtohet IBus, dhe në të ardhmen planifikohet një rrugë më natyrale Wayland përmes protokolleve të input-method/text-input.
Cilësimet e përdoruesit. Në ndërfaqen e planeve të cilat do të konfigurohen, duhet të përfshihen aktivizimi/dizaktivimi i STT, zgjedhja e çelësit të nxehtë, gjuhës së diktimit, mikrofonit, profilit të modelit, parametrave të përpunimit pas, dhe indikatorit të aktiviteteve.
Në iteratën e parë, jashtë projektit mbeten zgjuar nga fraza kryesore, dëgjimi i vazhdueshëm në background, njohja në re, asistenti vokal, komandat vokale, menaxhimi i desktopit, përkthimi i zërit, identifikimi i folësit, përcaktimi automatik i gjuhës dhe historia e diktimeve. Sipas fjalëve të tjera, Canonical nuk fillon me 'asistentin AI', por me një funksion më të zakonshëm: futjen e zërit lokal për aplikacionet e zakonshme Ubuntu.
Burimi: linux.org.ru
