Ժան-Բատիստ Լալման (Jean Baptiste Lallement), Canonical ընկերության ինժեներական տնօրենի կողմից ներկայացվեց Մինա (Myna) նախագիծը, որը զարգացնում է ձայնային ճանաչման հավելվածը, որը նախատեսվում է օգտագործել բնական լեզվով հրամանների ծանուցման և ձայնային մուտքի կազմակերպման համար Ubuntu Desktop-ում: Նախագիծը տարածվում է GPLv3 լիցենզիայի տակ, բայց հանրային պահոցում առայժմ միայն նախագծի մոդուլային ճարտարապետության և դրա Ubuntu-ով ինտեգրման նկարագիրը կա:
Ubuntu 26.10-ի թողարկման պահին ծրագիրը պլանավորում է հասցնել ձայնային մուտքի պատրաստականության: Համալիրում աշխատելու գործընթացը բաղկացած է վայրկյանական կոճակի օգնությամբ ակտիվացումից, բարձրաձայն Dictation-ից և ճանաչված տեքստի ներդնումից ներկա հավելվածի մեջ ստեղնաշարի մուտքի սիմուլացիայի միջոցով, ըստ խոսքի ընթացքի: Միկրոֆոնի միացման ժամանակ հատուկ ցուցիչ կներկայացվի աշխատանքային վահանակում:
Իրականացման համար հիմք ընդունած փորձնական միջավայրն է GNOME-ը, որն աշխատում է Wayland-ի վրա, սակայն հավելվածն սկզբունքորեն նախագծվել է աշխատատեղերի տարբեր միջավայրերի համադրելիության հնարավորության հաշվեհարդարով:
Myna-ում ճանաչման համար կիրառում է տեղական գործելու AI մոդել: Հավելվածի պահանջները ներառում են` ինտերնետ կապի բացակայությամբ աշխատելու հնարավորությունը; միկրոֆոնը ակտիվանում է միայն հրամաններով; ձայնի մշակման ընթացքում տեղեկատվությունը մաքրում է օգտագործման ավարտից հետո; ձայնի գրառումները չի փոխանցվում արտաքին ծառայություններ:
Ձայնի ճանաչման, օգտատիրոջ հետ փոխանակման, Dictation-ի կառավարում և տեքստի դասավորություն աշխատանքները զարգանում են մոդուլների տեսքով:
AI մոդելների կատարողական միջավայրը կիրականացվի snap-պակետի տեսքով: Tanագրվում են ճանաչման հնարավոր մոդելները՝ Whisper, Parakeet, NemoTron և Qwen3-ASR:
Dictation-ի կառավարող ծառայությունը հետևում է տաք կոճակի սեղմմանը, ակտիվացնում է միկրոֆոնը, դիմում API-ին AI մոդելի snap-պակետում, ուղղորդում է ձայնային հոսքը ձայնային ծառայությունից և համակարգում տվյալների հոսքերը:
Ձայնային ծառայությունը դիմում է ձայնային սարքին ինչպես ուղղակի, այնպես էլ ձայնային ավարտով, PulseAudio կամ PipeWire-ի միջոցով, մեղմացնում է աղմուկը և հավասարեցնում է ձայնի մակարդակը: Մոդելով ստեղծված տեքստը փոխանցվում է հետամուտ եղանակին մոդուլին մաքրում, նորմալացում, ձևավորում և կետադրում կատարելու համար: Վերջնական տեքստը ներդրվում է հավելվածում մուտքի ստեղնադիրի միջոցով, օրինակ՝ Wayland-ի input-method պրոտոկարի կամ IBus-ի միջոցով: սերվերներ Ավարտական ֆունկցիոնալության կայունացման րոպեին հնարավոր չէ բացառել ձայնային օգնականի առաջատարության, ձայնային հրամաններ կատարելու, աշխատանքային շրջանի ձայնային կառավարումը և խոսքի տեքստի ավտոմատ լեզվի ճանաչմամբ փոխանցումը:
Ամսվա սկզբում կայունացման փուլում չի բացառվի ձայնային օգնականի աշխատանքի, ձայնային հրամաներ կատարելու, աշխատանքային շրջանի ձայնային կառավարումը և հաղորդավար մասնակցություն գործողությունների ավտոմատ լեզվի ճանաչմամբ փոխանցումը:


Ընտանիք: opennet.ru
