Jean Baptiste Lallement, mühəndislik üzrə direktor Canonical şirkətində, Myna layihəsini təqdim edib, bu layihə danışığın tanınması tətbiqini inkişaf etdirir, hansı ki, Ubuntu Desktop-da səsli giriş və təbii dili anlamaq üçün istifadə ediləcək. Layihə GPLv3 lisenziyası altında yayılır, lakin indi repositorda yalnız layihənin modul arxitekturası və Ubuntu ilə inteqrasiyası barədə eskizlər mövcuddur.
Ubuntu 26.10-u buraxmağı planlaşdıraraq tətbiq, mətni səsli girişə hazırlayacaq. Tətbiqlə işləmə sesi klaviatura kombinasiyası ilə aktivləşmək, səsli diktə etmək və danışılan mətni indiki tətbiqə klaviatura girişinin simulyasiyası ilə yerləşdirməkdən ibarətdir. Mikrofon açıldığı zaman paneldə xüsusi bir indikator göstəriləcək.
Test mühiti olaraq GNOME, Wayland bazasında, seçilib, lakin tətbiq ilk növbədə fərqli masaüstü mühitlərinə uyğunlaşmaq üçün nəzərdə tutulur.
Myna-nın danışığı tanıması üçün yerli olaraq həyata keçirilən AI modeli istifadə olunacaq. Tətbiq üçün tələblər arasında: internet bağlantısı olmadan işləmə imkanı; diktə rejiminin açılması üçün isti düymənin açıq şəkildə aktivləşdirilməsi; hər istifadə sonrası yaddaşı təmizləyərək səsin emalı; səs qeydlərinin xarici xidmətlərə ötürülməsinin qadağan edilməsi.
Danışığın tanınması, istifadəçi ilə qarşılıqlı əlaqə, diktələri idarə etmə və mətni daxil etmə üçün komponentlər modul şəklində inkişaf etdirilir.
AI modellərinin icrası üçün mühit snap-paket şəklində düzənlənəcək. Danışığın tanınması üçün mümkün modellər arasında Whisper, Parakeet, NemoTron və Qwen3-ASR qeyd olunur.
Diktə idarəetmə xidməti isti düymənin basılmasını izləyir, mikrofonu aktivləşdirir, snap-paketdəki AI modelinə API vasitəsilə müraciət edir, səs axınını səs xidməti vasitəsilə ona yönləndirir və məlumat axınlarını koordinasiya edir.
Səs xidməti səs cihazına, həm birbaşa, həm də PulseAudio və ya PipeWire vasitəsilə müraciət edir, səsi boğur və səsi düzləşdirir. Model tərəfindən yaradılan mətn post-prosesinq moduluna ötürülür, burada təmizləmək, normallaşdırmaq, formatlaşdırmaq və durğu işarələrini yerləşdirmək üçün emal olunur. Final mətn tətbiqə daxil etmə vasitəsilə, məsələn, Wayland-protokolu input-method və ya IBus yolu ilə təqdim edilir. serverlər Başlanğıc funksionallığı stabil olduqdan sonra danışıq köməkçisi, danışıq əmrini icra etmə, masaüstünü səsli idarə etmə və avtomatik dil tanıma ilə diktə edilən mətni tərcümə etmə kimi imkanların təmin edilməsi mümkündür.
Başlanğıc funksionallığı stabil olduqdan sonra səsli köməkçi kimi fəaliyyət, səsli əmr icrası, masaüstünü səsli idarə etmə və avtomatik dil tanıma ilə diktə edilən mətni tərcümə etmə kimi imkanların əlavə edilməsi istisna edilmir.


Mənbə: opennet.ru
