Canonical prezantoi Myna — njĂ« sistem lokal tĂ« shndĂ«rrimit tĂ« tĂ« folurit nĂ« tekst pĂ«r Ubuntu Desktop

Canonical prezantoi projektin Myna — njĂ« sistem tĂ« ri tĂ« konvertimit tĂ« zĂ«rit nĂ« tekst pĂ«r Ubuntu Desktop. Projekti synon thjeshtĂ«sinĂ« e diktimeve: pĂ«rdoruesi shtyp njĂ« kombinim çelĂ«sish, flet dhe teksti i njohur shfaqet nĂ« aplikacionin aktiv. NĂ« njoftimin e saj nĂ«nvizohet se Myna duhet tĂ« ndjehet si njĂ« pjesĂ« natyrale e desktopit tĂ« Ubuntu dhe tĂ« funksionojĂ« duke respektuar privatĂ«sinĂ« e pĂ«rdoruesit. Lista e gjuhĂ«ve tĂ« mbĂ«shtetura pĂ«r hyrje nĂ« momentin e publikimit tĂ« lajmit nuk Ă«shtĂ« bĂ«rĂ« e njohur.

Qëllimi i parë i projektit është Ubuntu 26.10. Në këtë fazë, Canonical nuk përpiqet të krijojë një asistënt të plotë të zërit ose një sistem menaxhimi të desktopit me zë. Zhvilluesit me qëllim e kanë kufizuar fushën e versionit të parë në një diktim bazik dhe të besueshëm: të shtypësh një kombinim çelësish, të thuash tekstin dhe të marrësh rezultatin në fushën e aktuale të hyrjes. Mjedisi i parë i verifikueshëm është Ubuntu Desktop mbi Wayland me GNOME, por arkitektura pritet të mbetet mjaft e hapur për mbështetje të ardhshme për ambientet e tjera.

Myna është e destinuar për njohjen lokale të zërit. Pas instalimit të modeleve të nevojshme, lidhja me internetin për funksionimin e diktimeve nuk kërkohet, mikrofonin duhet ta përdorë vetëm pas aktivizimit të qartë nga përdoruesi, audio përpunohen në memorie dhe pastaj hidhen, dhe regjistrimet nuk dërgohen në shërbime të jashtme. Në specifikimin e projektit gjithashtu është e theksuar se zgjidhja duhet t'i shmangë ruajtjes së audios si parazgjedhje dhe nuk duhet të kalojë fshehurazi në një shërbim cloud.

Kodi dhe dokumentacioni i Myna janë publikuar në depozitën Canonical në GitHub. Projekti përshkruhet si një aplikacion i lehtë për shndërrimin e zërit në tekst për Ubuntu Desktop dhe shpërndahet nën licencën GPL-3.0. Megjithatë, projekti është në një fazë të hershme: në depo nuk ka ende lëshime të publikuara, dhe specifikimi arkitekturor ka statusin e Propozuar.

Funksionet dhe karakteristikat kryesore të Myna

  • Diktimi Push-to-talk. PĂ«rdoruesi mba njĂ« çelĂ«s tĂ« personalizueshĂ«m, flet dhe sistemi e ngjitesh tekstin e njohur nĂ« fushĂ«n e zgjedhur tĂ« hyrjes. Diktimi pĂ«rfundon sapo tĂ« lĂ«shosh çelĂ«sin.

  • Njohja lokale e zĂ«rit. Njohja bĂ«het nĂ« makinĂ«n e pĂ«rdoruesit pĂ«rmes njĂ« staku lokal tĂ« inference. Kjo redukton varĂ«sinĂ« nga cloud-i dhe lejon funksionimin pa rrjet pas instalimit tĂ« modeleve.

  • PĂ«rpunimi privat i audios. Mikrofoni aktivizohet vetĂ«m gjatĂ« sesionit tĂ« pĂ«rdoruesit pĂ«r diktimin. Audioja nuk duhet tĂ« regjistrohet nĂ« disk siç Ă«shtĂ«, pĂ«rdoret njĂ« tampon i kufizuar nĂ« memorie, i cili pastron pas pĂ«rfundimit tĂ« sesionit.

  • Tregues vizual aktiviteti. GjatĂ« regjistrimit dhe transkriptimit, pĂ«rdoruesi duhet tĂ« shohĂ« njĂ« tregues tĂ« qartĂ« tĂ« gjendjes. Specifikimi pĂ«rmend gjendje si Regjistrimi, Transkriptimi, PĂ«rfundimi dhe Gabimi.

  • Futja vetĂ«m e tekstit tĂ« qĂ«ndrueshĂ«m. NĂ« realizimin e parĂ«, hipotezat pĂ«rkatĂ«se tĂ« njohjes nuk duhet tĂ« futen direkt nĂ« aplikacion. NĂ« fushĂ«n e destinacionit dĂ«rgohet vetĂ«m teksti pĂ«rfundimtar i konfirmuar.

  • Pasprocesimi i tekstit. Transkriptimi i papĂ«rpunuar mund tĂ« kalojĂ« normalizimin, vendosjen e pikĂ«simit, kapitalizimin, formatimin dhe konvertimin e formave gojore nĂ« forma shkruese, p.sh. "twenty two" → "22".

  • Zgjedhja e gjuhĂ«s sĂ« diktimit. Sistema duhet tĂ« mbĂ«shtesĂ« gjuhĂ«n e diktimit tĂ« personalizueshme, duke u mbĂ«shtetur nĂ« mĂ«nyrĂ« tĂ« paracaktuar nĂ« gjuhĂ«n e ndĂ«rfaqes sĂ« pĂ«rdoruesit, nĂ«se njĂ« model i pĂ«rshtatshĂ«m Ă«shtĂ« nĂ« dispozicion.

  • Profili i cilĂ«sisĂ« sĂ« modelit. Specifikimi parashikon profile tĂ« ndryshme tĂ« modeleve: njĂ« variant tĂ« lehtĂ« me konsum mĂ« tĂ« ulĂ«t tĂ« burimeve, njĂ« profil tĂ« ekuilibruar si default dhe njĂ« variant mĂ« cilĂ«sor, por mĂ« tĂ« rĂ«ndĂ«.

  • Puna e sigurt me fokusin e hyrjes. QĂ«llimi pĂ«r tĂ« futur tekstin zgjidhet nĂ« fillim tĂ« sesionit. NĂ«se fokusi i dritares ndryshon gjatĂ« diktimit, sistemi nuk duhet tĂ« dĂ«rgojĂ« heshtazi tekstin nĂ« njĂ« aplikacion tjetĂ«r.

  • Blo kĂ«imi nĂ« fushat e mbrojtura. Diktimi duhet tĂ« bllokohet nĂ« fushat e fjalĂ«kalimit, dritaret e autentifikimit dhe vende tĂ« tjera tĂ« mbrojtura, nĂ«se aplikacioni ose toolkit-i e lejojnĂ« kĂ«tĂ« tĂ« pĂ«rcaktohet.

  • Integrimi me Wayland/GNOME. Versioni i parĂ« Ă«shtĂ« i orientuar ndaj Wayland dhe GNOME. PĂ«r futjen fillestare tĂ« tekstit shqyrtohet IBus, dhe nĂ« tĂ« ardhmen planifikohet njĂ« qasje mĂ« natyrale pĂ«rmes protokolleve input-method/text-input.

  • CilĂ«simet e pĂ«rdoruesit. NĂ« ndĂ«rfaqen e planifikuar tĂ« cilĂ«simeve duhet tĂ« pĂ«rfshihen aktivizimi/çaktivizimi i STT, zgjedhja e çelĂ«sit tĂ« nxehtĂ«, gjuhĂ«s sĂ« diktimit, mikrofoni, profili i modelit, parametrat e pasprocesimit dhe treguesi i aktivitetit.

Në iteracionin e parë, jashtë projektit mbeten zgjerimi i frazës kyçe, dëgjimi i vazhdueshëm në sfond, njohja në re, ndihmësi vokal, komandat vokale, menaxhimi i desktopit, përkthimi i fjalëve, identifikimi i folësit, përcaktimi automatik i gjuhës dhe historia e diktimit. Në terma të tjerë, Canonical nuk fillon me "ndihmësin AI", por me një funksion më të thjeshtë: vendosja lokale e hyrjes vokale në aplikacione të zakonshme Ubuntu.

Burimi: linux.org.ru

Blini hosting tĂ« besueshĂ«m pĂ«r faqe interneti me mbrojtje nga DDoS, serverĂ« VPS VDS đŸ”„ Blini hosting tĂ« besueshĂ«m pĂ«r faqe interneti me mbrojtje nga DDoS, serverĂ« VPS VDS | ProHoster