
Canonical ka paraqitur projektin Myna — një sistem të ri të shndërrimit të zërit në tekst për Ubuntu Desktop. Projekti synon dictimin e integruar: përdoruesi shtyp një tast të nxehtë, flet, dhe teksti i njohur shfaqet në aplikacionin aktiv. Në njoftim theksohet se Myna duhet të ndihet si një pjesë natyrore e desktopit të Ubuntu dhe të funksionojë me respekt për privatësinë e përdoruesit. Lista e gjuhëve të mbështetura për hyrje në momentin e publikimit të lajmit nuk është bërë e njohur.
Qëllimi i parë i projektit — Ubuntu 26.10. Në këtë fazë, Canonical nuk përpiqet të krijojë një ndihmës zanor të plotë ose një sistem kontrolli të desktopit me zë. Zhvilluesit e kanë kufizuar qëllimisht fushën e versionit të parë në dictimin thelbësor dhe të besueshëm: shtypni kombinimin e çelësit, flisni tekstin dhe merrni rezultatin në fushën aktuale të hyrjes. Mjedisi i parë i verifikueshëm — Ubuntu Desktop në Wayland me GNOME, por arkitektura planifikon të mbetet mjaft e hapur për mbështetje të ardhshme të ambienteve të tjera.
Myna është e dizajnuar për njohjen lokale të të folurit. Pas instalimit të modeleve të nevojshme, nuk kërkohet lidhje interneti për të punuar me diktimin, mikrofonin duhet ta përdorë vetëm pas aktivizimit të qartë nga përdoruesi, audio përpunoset në memorje dhe pastaj hidhet, ndërsa regjistrimet nuk dërgohen në shërbime të jashtme. Në specifikimin e projektit gjithashtu përcaktohet se zgjidhja duhet të shmangë ruajtjen e audios si rregull dhe nuk duhet të kalojë papritur në një shërbim në re.
Kodi dhe dokumentacioni i Myna janë publikuar në depozitën Canonical në GitHub. Projekti përshkruhet si një aplikacion i lehtë speech-to-text për Ubuntu Desktop dhe shpërndahet nën licencën GPL-3.0. Ndërkohë, projekti është në fazën fillestare: në depozitë nuk ka ende versione të publikuara, dhe specifikimi arkitektonik ka statusin Proposed.
Funksionet kryesore dhe veçoritë e Myna
Diktimi Push-to-talk. Përdoruesi mban një buton të nxehtë të përshtatshëm, flet, dhe sistemi fut tekstin e njohur në fushën e zgjedhur për input. Diktimi përfundon pas lirimit të çelësit.
Njohje lokale e të folurit. Njohja bëhet në makinën e përdoruesit përmes një grumbulli inferencë lokal. Kjo zvogëlon varësinë nga shërbimet cloud dhe lejon punën pa rrjet pas instalimit të modeleve.
Përpunim privat të audios. Mikrofoni aktivizohet vetëm gjatë sesionit të përdoruesit të diktatës. Audio nuk duhet të regjistrohet në disk si rregull, përdoret një bufers i kufizuar në memory që pastron pas përfundimit të sesionit.
Tregues vizual aktiviteti. Gjatë regjistrimit dhe transkriptimit, përdoruesi duhet të shohë një tregues gjendjeje të qartë. Në specifikim përmenden gjendje si Regjistrimi, Transkriptimi, Finalizimi dhe Gabimi.
Futja e vetëm tekstit stabil. Në implementimin e parë, hipotezat e ndërmjetme të njohjes nuk duhet të vendosen direkt në aplikacion. Në fushën përfundimtare dërgohet vetëm teksti final të konfirmuar.
Pas përpunimi i tekstit. Shkruarja e papërpunuar mund të kalojë normalizimin, vendosjen e pikave, kapitalizimin, formatimin dhe transformimin e formave gojore në ato të shkruara, për shembull, “twenty two” → “22”.
Zgjedhja e gjuhës së diktatës. Sistemi duhet të mbështesë një gjuhë të personalizuar për diktim, duke u bazuar në mënyrë të parazgjedhur në gjuhën e ndërfaqes së përdoruesit, nëse një model i përshtatshëm është në dispozicion.
Profillet e cilësisë së modelit. Specifikimi përfshin profile të ndryshme modeli: një variant të lehtë me konsum më të vogël resursesh, një profil të balancuar si parazgjedhje dhe një variant më cilësor, por më të rëndë.
Punë e sigurt me fokusin e hyrjes. Qëllimi për futjen e tekstit zgjidhet në fillim të sesionit. Nëse fokusi i dritares ndryshon gjatë diktimit, sistemi nuk duhet ta dërgojë heshtazi tekstin në një aplikacion tjetër.
Bloakimi në fusha të mbrojtura. Diktimi duhet të bllokohet në fusha password, dritare autentifikimi dhe vende të tjera të mbrojtura, nëse aplikacioni ose grupi i veglave e lejon këtë të përcaktohet.
Integrimi me Wayland/GNOME. Versioni i parë fokusohet në Wayland dhe GNOME. Për futjen fillestare të tekstit shqyrtohet IBus, dhe në të ardhmen planifikohet një rrugë më natyrale Wayland përmes protokolleve të input-method/text-input.
Cilësimet e përdoruesit. Në ndërfaqen e planeve të cilat do të konfigurohen, duhet të përfshihen aktivizimi/dizaktivimi i STT, zgjedhja e çelësit të nxehtë, gjuhës së diktimit, mikrofonit, profilit të modelit, parametrave të përpunimit pas, dhe indikatorit të aktiviteteve.
Në iteratën e parë, jashtë projektit mbeten zgjuar nga fraza kryesore, dëgjimi i vazhdueshëm në background, njohja në re, asistenti vokal, komandat vokale, menaxhimi i desktopit, përkthimi i zërit, identifikimi i folësit, përcaktimi automatik i gjuhës dhe historia e diktimeve. Sipas fjalëve të tjera, Canonical nuk fillon me 'asistentin AI', por me një funksion më të zakonshëm: futjen e zërit lokal për aplikacionet e zakonshme Ubuntu.
Burimi: linux.org.ru
