Canonical prezantoi Myna — njĂ« sistem lokal pĂ«r shndĂ«rrimin e tĂ« folurit nĂ« tekst pĂ«r Ubuntu Desktop

Canonical ka paraqitur projektin Myna — njĂ« sistem tĂ« ri tĂ« shndĂ«rrimit tĂ« zĂ«rit nĂ« tekst pĂ«r Ubuntu Desktop. Projekti synon dictimin e integruar: pĂ«rdoruesi shtyp njĂ« tast tĂ« nxehtĂ«, flet, dhe teksti i njohur shfaqet nĂ« aplikacionin aktiv. NĂ« njoftim theksohet se Myna duhet tĂ« ndihet si njĂ« pjesĂ« natyrore e desktopit tĂ« Ubuntu dhe tĂ« funksionojĂ« me respekt pĂ«r privatĂ«sinĂ« e pĂ«rdoruesit. Lista e gjuhĂ«ve tĂ« mbĂ«shtetura pĂ«r hyrje nĂ« momentin e publikimit tĂ« lajmit nuk Ă«shtĂ« bĂ«rĂ« e njohur.

QĂ«llimi i parĂ« i projektit — Ubuntu 26.10. NĂ« kĂ«tĂ« fazĂ«, Canonical nuk pĂ«rpiqet tĂ« krijojĂ« njĂ« ndihmĂ«s zanor tĂ« plotĂ« ose njĂ« sistem kontrolli tĂ« desktopit me zĂ«. Zhvilluesit e kanĂ« kufizuar qĂ«llimisht fushĂ«n e versionit tĂ« parĂ« nĂ« dictimin thelbĂ«sor dhe tĂ« besueshĂ«m: shtypni kombinimin e çelĂ«sit, flisni tekstin dhe merrni rezultatin nĂ« fushĂ«n aktuale tĂ« hyrjes. Mjedisi i parĂ« i verifikueshĂ«m — Ubuntu Desktop nĂ« Wayland me GNOME, por arkitektura planifikon tĂ« mbetet mjaft e hapur pĂ«r mbĂ«shtetje tĂ« ardhshme tĂ« ambienteve tĂ« tjera.

Myna është e dizajnuar për njohjen lokale të të folurit. Pas instalimit të modeleve të nevojshme, nuk kërkohet lidhje interneti për të punuar me diktimin, mikrofonin duhet ta përdorë vetëm pas aktivizimit të qartë nga përdoruesi, audio përpunoset në memorje dhe pastaj hidhet, ndërsa regjistrimet nuk dërgohen në shërbime të jashtme. Në specifikimin e projektit gjithashtu përcaktohet se zgjidhja duhet të shmangë ruajtjen e audios si rregull dhe nuk duhet të kalojë papritur në një shërbim në re.

Kodi dhe dokumentacioni i Myna janë publikuar në depozitën Canonical në GitHub. Projekti përshkruhet si një aplikacion i lehtë speech-to-text për Ubuntu Desktop dhe shpërndahet nën licencën GPL-3.0. Ndërkohë, projekti është në fazën fillestare: në depozitë nuk ka ende versione të publikuara, dhe specifikimi arkitektonik ka statusin Proposed.

Funksionet kryesore dhe veçoritë e Myna

  • Diktimi Push-to-talk. PĂ«rdoruesi mban njĂ« buton tĂ« nxehtĂ« tĂ« pĂ«rshtatshĂ«m, flet, dhe sistemi fut tekstin e njohur nĂ« fushĂ«n e zgjedhur pĂ«r input. Diktimi pĂ«rfundon pas lirimit tĂ« çelĂ«sit.

  • Njohje lokale e tĂ« folurit. Njohja bĂ«het nĂ« makinĂ«n e pĂ«rdoruesit pĂ«rmes njĂ« grumbulli inferencĂ« lokal. Kjo zvogĂ«lon varĂ«sinĂ« nga shĂ«rbimet cloud dhe lejon punĂ«n pa rrjet pas instalimit tĂ« modeleve.

  • PĂ«rpunim privat tĂ« audios. Mikrofoni aktivizohet vetĂ«m gjatĂ« sesionit tĂ« pĂ«rdoruesit tĂ« diktatĂ«s. Audio nuk duhet tĂ« regjistrohet nĂ« disk si rregull, pĂ«rdoret njĂ« bufers i kufizuar nĂ« memory qĂ« pastron pas pĂ«rfundimit tĂ« sesionit.

  • Tregues vizual aktiviteti. GjatĂ« regjistrimit dhe transkriptimit, pĂ«rdoruesi duhet tĂ« shohĂ« njĂ« tregues gjendjeje tĂ« qartĂ«. NĂ« specifikim pĂ«rmenden gjendje si Regjistrimi, Transkriptimi, Finalizimi dhe Gabimi.

  • Futja e vetĂ«m tekstit stabil. NĂ« implementimin e parĂ«, hipotezat e ndĂ«rmjetme tĂ« njohjes nuk duhet tĂ« vendosen direkt nĂ« aplikacion. NĂ« fushĂ«n pĂ«rfundimtare dĂ«rgohet vetĂ«m teksti final tĂ« konfirmuar.

  • Pas pĂ«rpunimi i tekstit. Shkruarja e papĂ«rpunuar mund tĂ« kalojĂ« normalizimin, vendosjen e pikave, kapitalizimin, formatimin dhe transformimin e formave gojore nĂ« ato tĂ« shkruara, pĂ«r shembull, “twenty two” → “22”.

  • Zgjedhja e gjuhĂ«s sĂ« diktatĂ«s. Sistemi duhet tĂ« mbĂ«shtesĂ« njĂ« gjuhĂ« tĂ« personalizuar pĂ«r diktim, duke u bazuar nĂ« mĂ«nyrĂ« tĂ« parazgjedhur nĂ« gjuhĂ«n e ndĂ«rfaqes sĂ« pĂ«rdoruesit, nĂ«se njĂ« model i pĂ«rshtatshĂ«m Ă«shtĂ« nĂ« dispozicion.

  • Profillet e cilĂ«sisĂ« sĂ« modelit. Specifikimi pĂ«rfshin profile tĂ« ndryshme modeli: njĂ« variant tĂ« lehtĂ« me konsum mĂ« tĂ« vogĂ«l resursesh, njĂ« profil tĂ« balancuar si parazgjedhje dhe njĂ« variant mĂ« cilĂ«sor, por mĂ« tĂ« rĂ«ndĂ«.

  • PunĂ« e sigurt me fokusin e hyrjes. QĂ«llimi pĂ«r futjen e tekstit zgjidhet nĂ« fillim tĂ« sesionit. NĂ«se fokusi i dritares ndryshon gjatĂ« diktimit, sistemi nuk duhet ta dĂ«rgojĂ« heshtazi tekstin nĂ« njĂ« aplikacion tjetĂ«r.

  • Bloakimi nĂ« fusha tĂ« mbrojtura. Diktimi duhet tĂ« bllokohet nĂ« fusha password, dritare autentifikimi dhe vende tĂ« tjera tĂ« mbrojtura, nĂ«se aplikacioni ose grupi i veglave e lejon kĂ«tĂ« tĂ« pĂ«rcaktohet.

  • Integrimi me Wayland/GNOME. Versioni i parĂ« fokusohet nĂ« Wayland dhe GNOME. PĂ«r futjen fillestare tĂ« tekstit shqyrtohet IBus, dhe nĂ« tĂ« ardhmen planifikohet njĂ« rrugĂ« mĂ« natyrale Wayland pĂ«rmes protokolleve tĂ« input-method/text-input.

  • CilĂ«simet e pĂ«rdoruesit. NĂ« ndĂ«rfaqen e planeve tĂ« cilat do tĂ« konfigurohen, duhet tĂ« pĂ«rfshihen aktivizimi/dizaktivimi i STT, zgjedhja e çelĂ«sit tĂ« nxehtĂ«, gjuhĂ«s sĂ« diktimit, mikrofonit, profilit tĂ« modelit, parametrave tĂ« pĂ«rpunimit pas, dhe indikatorit tĂ« aktiviteteve.

Në iteratën e parë, jashtë projektit mbeten zgjuar nga fraza kryesore, dëgjimi i vazhdueshëm në background, njohja në re, asistenti vokal, komandat vokale, menaxhimi i desktopit, përkthimi i zërit, identifikimi i folësit, përcaktimi automatik i gjuhës dhe historia e diktimeve. Sipas fjalëve të tjera, Canonical nuk fillon me 'asistentin AI', por me një funksion më të zakonshëm: futjen e zërit lokal për aplikacionet e zakonshme Ubuntu.

Burimi: linux.org.ru

Bleni hostim tĂ« besueshĂ«m pĂ«r faqe me mbrojtje nga DDoS, serverĂ« VPS VDS đŸ”„ Bleni hostim tĂ« besueshĂ«m pĂ«r faqe me mbrojtje nga DDoS, serverĂ« VPS VDS | ProHoster