
קנוניקל הציגה את הפרויקט מיינה - מערכת חדשה להמרת דיבור לטקסט עבור Ubuntu שולחן עבודה. הפרויקט שואף לספק הכתבה משולבת: המשתמש לוחץ על מקש קיצור, מדבר, והטקסט המזוהה מופיע ביישום הפעיל. ההכרזה מדגישה כי מיינה צריכה להרגיש כחלק טבעי משולחן העבודה. Ubuntu ובמקביל לעבוד תוך התחשבות בפרטיות המשתמש. רשימת שפות הקלט הנתמכות לא פורסמה בזמן הפרסום.
המטרה הראשונה של הפרויקט היא Ubuntu 26.10בשלב זה, קנוניקל לא מנסה לפתח עוזר קולי מלא או מערכת ניהול שולחן עבודה מבוססת קול. המפתחים הגבילו במכוון את היקף הגרסה הראשונה להכתבה בסיסית ואמינה: לחיצה על צירוף מקשים, אמירת טקסט וקבלת התוצאה בשדה הקלט הנוכחי. הסביבה העיקרית הנבדקת היא Ubuntu שולחן עבודה על Wayland עם GNOME, אך הארכיטקטורה מתוכננת להישאר פתוחה מספיק כדי לתמוך בסביבות אחרות בעתיד.
Myna מיועד לזיהוי דיבור מקומי. לאחר התקנת המודלים הדרושים, הכתבה אינה דורשת חיבור לאינטרנט. יש להשתמש במיקרופון רק לאחר הפעלה מפורשת על ידי המשתמש. האודיו מעובד בזיכרון ולאחר מכן נמחק, וההקלטות אינן נשלחות לשירותים חיצוניים. מפרט התכנון מציין גם כי הפתרון צריך להימנע מאחסון אודיו כברירת מחדל ולא צריך לעבור בצורה חלקה לשירות ענן.
קוד ותיעוד של Myna מתפרסמים במאגר הקנוניקל בכתובת GitHubהפרויקט מתואר כאפליקציית דיבור לטקסט קלת משקל עבור Ubuntu Desktop ומופץ תחת רישיון GPL-3.0. עם זאת, הפרויקט נמצא בשלביו הראשונים: עדיין אין גרסאות שפורסמו במאגר, והמפרט האדריכלי רשום כ-"מוצע".
תכונות ופונקציות עיקריות של מיינה
הכתבה מסוג Push-to-Talk. המשתמש מחזיק מקש קיצור דרך הניתן להגדרה, מדבר, והמערכת מכניסה את הטקסט המזוהה לשדה הקלט שנבחר. ההכתבה מסתיימת עם שחרור המקש.
זיהוי דיבור מקומי. הזיהוי מתבצע במחשב המשתמש באמצעות מחסנית הסקה מקומית. זה מפחית את התלות בענן ומאפשר פעולה לא מקוונת לאחר התקנת המודל.
עיבוד אודיו פרטי. המיקרופון מופעל רק במהלך הפעלת הכתבה של המשתמש. כברירת מחדל, השמע אינו נכתב לדיסק; נעשה שימוש במאגר זיכרון מוגבל, אשר מנוקה לאחר סיום ההפעלה.
מחוון פעילות חזותי. במהלך ההקלטה והתמלול, המשתמש אמור לראות מחוון סטטוס ברור. המפרט מציין מצבים כגון הקלטה, תמלול, סיום ושגיאה.
הכנס רק טקסט יציב. במימוש הראשון, אין להזין ישירות לאפליקציה השערות זיהוי ביניים. רק הטקסט הסופי שאושר נשלח לשדה היעד.
עיבוד לאחר הטקסט. התמליל הגולמי עשוי לעבור נורמליזציה, פיסוק, שימוש באותיות גדולות, עיצוב והמרה של צורות מדוברות לצורות כתובות, כגון "עשרים ושתיים" → "22".
בחירת שפת ההכתבה. המערכת חייבת לתמוך בשפת הכתבה מותאמת אישית, כאשר ברירת המחדל היא לשפת ממשק המשתמש אם קיים מודל מתאים עבורה.
פרופילי איכות מודל. המפרט כולל פרופילי מודל שונים: גרסה קלת משקל עם צריכת משאבים נמוכה יותר, פרופיל ברירת מחדל מאוזן וגרסה איכותית יותר אך כבדה יותר.
עבודה בטוחה עם מיקוד קלט. היעד להכנסת טקסט נבחר בתחילת ההפעלה. אם מוקד החלון משתנה במהלך ההכתבה, המערכת לא אמורה לשלוח את הטקסט באופן שקט ליישום אחר.
חסימה בשדות מוגנים. יש לחסום הכתבה בשדות סיסמה, חלונות אימות ואזורים מאובטחים אחרים אם היישום או ערכת הכלים מאפשרים זאת.
אינטגרציה עם Wayland/GNOME. הגרסה הראשונה מיועדת ל-Wayland ול-GNOME. IBus נשקל להכנסת טקסט ראשונית, וגישה מקורית יותר של Wayland באמצעות פרוטוקולי input-method/text-input מתוכננת בעתיד.
הגדרות משתמש. ממשק ההגדרות המתוכנן צריך לכלול הפעלה/השבתה של STT, בחירת מקש קיצור, שפת הכתבה, מיקרופון, פרופיל דגם, פרמטרים של עיבוד לאחר הפעולה ומחוון פעילות.
הגרסה הראשונה של הפרויקט אינה כוללת השכמה עם ביטוי מפתח, האזנה מתמשכת ברקע, זיהוי ענן, עוזר קולי, פקודות קוליות, ניהול שולחן עבודה, תרגום דיבור, זיהוי רמקולים, זיהוי שפה אוטומטי והיסטוריית הכתבה. במילים אחרות, קנוניקל מתחילה לא עם "עוזר בינה מלאכותית", אלא עם תכונה פשוטה יותר: קלט קולי מקומי עבור טקסט באפליקציות רגילות. Ubuntu.
מקור: linux.org.ru
