Canonical представи Myna — локална система за преобразуване на реч в текст за Ubuntu Desktop

Canonical представи проекта Myna — нова система за преобразуване на реч в текст за Ubuntu Desktop. Проектът е насочен към вградена диктовка: потребителят натиска комбинация от клавиши, говори и разпознатият текст се появява в активно приложение. В анонса се подчертава, че Myna трябва да се усеща като естествена част от работния плот на Ubuntu и същевременно да работи с внимание към личната неприкосновеност на потребителя. Списъкът с поддържаните езици за въвеждане към момента на публикуване на новината не е обявен.

Първата цел на проекта е Ubuntu 26.10. На този етап Canonical не се опитва да създаде пълноценен гласов асистент или система за управление на работния плот чрез глас. Разработчиците умишлено ограничиха обхвата на първата версия до основна, надеждна диктовка: натискате комбинация от клавиши, произнасяте текст и получавате резултата в текущото поле за въвеждане. Първоначалната проверяема среда е Ubuntu Desktop на Wayland с GNOME, но архитектурата се планира да остане достатъчно отворена за бъдеща поддръжка на други среди.

Myna е проектирана за локално разпознаване на реч. След инсталиране на необходимите модели, интернет връзка за работа на диктовката не е необходима, микрофонът трябва да се използва само след ясна активация от потребителя, аудиото се обработва в паметта и след това се изхвърля, а записите не се изпращат на външни услуги. В спецификацията на проекта също е посочено, че решението трябва да избягва запазването на аудиото по подразбиране и не трябва незабелязано да преминава на облачна услуга.

Кодът и документацията на Myna са публикувани в хранилището на Canonical на GitHub. Проектът е описан като леко приложение за преобразуване на реч в текст за Ubuntu Desktop и се разпространява под лиценза GPL-3.0. При това проектът е на ранен етап: в хранилището все още няма публикувани версии, а архитектурната спецификация има статус Proposed.

Основни функции и характеристики на Myna

  • Диктовка с натискане на клавиша. Потребителят задържа настраиваема клавишна комбинация, говори и системата вмъква разпознатия текст в избраното поле за въвеждане. Диктовката завършва след отпускане на клавиша.

  • Локално разпознаване на реч. Разпознаването се извършва на машината на потребителя чрез локален инференс стек. Това намалява зависимостта от облака и позволява работа без интернет след инсталирането на моделите.

  • Частна обработка на аудио. Микрофонът се активира само по време на сесия на диктовка. Аудиото не трябва да бъде записвано на диск по подразбиране, използва се ограничен буфер в паметта, който се изчиства след завършване на сесията.

  • Визуален индикатор за активност. По време на запис и транскрипция потребителят трябва да вижда ясен индикатор за състоянието. В спецификацията се упоменавают състояния, като Recording, Transcribing, Finalizing и Error.

  • Вмъкване само на стабилен текст. В първата реализация междинните хипотези за разпознаване не трябва да се вмъкват директно в приложението. В целевото поле се изпраща само потвърдения финален текст.

  • Постобработка на текста. Суровата транскрипция може да премине нормализация, добавяне на пунктуация, капитализация, форматиране и преобразуване на устни форми в писмени, например 'twenty two' → '22'.

  • Избор на език за диктовка. Системата трябва да поддържа конфигурируем език за диктовка, като по подразбиране се основава на езика на потребителския интерфейс, ако за него е наличен подходящ модел.

  • Профили на качеството на модела. В спецификацията са предвидени различни профили за модели: лек вариант с по-ниска консумация на ресурси, балансиран профил по подразбиране и по-качествен, но по-тежък вариант.

  • Сигурна работа с фокуса на въвеждане. Целта за вмъкване на текст се избира в началото на сесията. Ако фокусът на прозореца се променя по време на диктовката, системата не трябва безмълвно да изпраща текста в друго приложение.

  • Блокиране в защитени полета. Диктовката трябва да бъде блокирана в полета за пароли, автентификационни прозорци и други защитени места, ако приложението или тулкита позволява това да се определи.

  • Интеграция с Wayland/GNOME. Първата версия е насочена към Wayland и GNOME. За начално вмъкване на текст се разглежда IBus, а в бъдеще се планира по-нативен Wayland път чрез input-method/text-input протоколите.

  • Настройки на потребителя. В планирания интерфейс за настройки трябва да има включване/изключване на STT, избор на гореща клавиша, език на диктовка, микрофон, профил на модела, параметри за постобработка и индикатор за активност.

В първата итерация извън проекта остават пробуждането по ключова фраза, постоянно фоново слушане, облачно разпознаване, гласов асистент, гласови команди, управление на работния плот, превод на реч, определяне на говорителя, автоматично разпознаване на езика и история на диктовките. С други думи, Canonical започва не с 'AI асистент', а с по-приземена функция: локален гласов вход на текст в обикновени приложения на Ubuntu.

Източник: linux.org.ru

Купете надежден хостинг за сайтове с защита от DDoS, VPS VDS сървъри 🔥 Купете надежден хостинг за сайтове с защита от DDoS, VPS VDS сървъри | ProHoster