Canonical hat Myna vorgestellt - ein lokales Spracherkennungssystem fĂŒr Ubuntu Desktop

Canonical stellte das Projekt vor Myna — ein neues System zur Sprach-zu-Text-Umwandlung fĂŒr Ubuntu Desktop. Das Projekt zielt auf die integrierte Diktierfunktion ab: Der Benutzer drĂŒckt eine Tastenkombination, spricht und der erkannte Text erscheint in der aktiven Anwendung. Im AnkĂŒndigung wird betont, dass Myna sich wie ein natĂŒrlicher Teil des Ubuntu-Desktops anfĂŒhlen soll und dabei die PrivatsphĂ€re des Nutzers berĂŒcksichtigt. Die Liste der unterstĂŒtzten Eingabesprachen wurde zum Zeitpunkt der Veröffentlichung der Nachricht nicht bekannt gegeben.

Das erste Ziel des Projekts ist Ubuntu 26.10. In dieser Phase versucht Canonical nicht, einen vollwertigen sprachgesteuerten Assistenten oder ein Sprachsteuerungssystem fĂŒr den Desktop zu entwickeln. Die Entwickler haben absichtlich den Rahmen der ersten Version auf ein einfaches, zuverlĂ€ssiges Diktat beschrĂ€nkt: Tastenkombination drĂŒcken, Text aussprechen und das Ergebnis im aktuellen Eingabefeld erhalten. Die primĂ€re getestete Umgebung ist Ubuntu Desktop unter Wayland mit GNOME, aber die Architektur soll offen genug fĂŒr zukĂŒnftige UnterstĂŒtzung anderer Umgebungen bleiben.

Myna ist auf die lokale Spracherkennung ausgelegt. Nach der Installation der erforderlichen Modelle ist keine Internetverbindung fĂŒr das Diktieren erforderlich, das Mikrofon sollte nur nach ausdrĂŒcklicher Aktivierung durch den Benutzer verwendet werden, Audio wird im Speicher verarbeitet und anschließend verworfen, und Aufzeichnungen werden nicht an externe Dienste gesendet. In den Projektspezifikationen wird auch angegeben, dass die Lösung standardmĂ€ĂŸig die Speicherung von Audio vermeiden sollte und nicht heimlich auf einen Cloud-Dienst umschalten darf.

Der Code und die Dokumentation von Myna sind im Repository von Canonical veröffentlicht GitHub. Das Projekt wird als leichtes Speech-to-Text-Anwendung fĂŒr Ubuntu Desktop beschrieben und unter der GPL-3.0-Lizenz vertrieben. Das Projekt befindet sich jedoch noch in einem frĂŒhen Stadium: Im Repository gibt es bisher keine veröffentlichten Versionen, und die architektonische Spezifikation hat den Status Vorschlag.

Hauptfunktionen und Merkmale von Myna

  • Push-to-Talk-Diktat. Der Benutzer hĂ€lt die anpassbare Tastenkombination gedrĂŒckt, spricht, und das System fĂŒgt den erkannten Text in das gewĂ€hlte Eingabefeld ein. Das Diktat endet mit dem Loslassen der Taste.

  • Lokale Spracherkennung. Die Erkennung erfolgt auf dem GerĂ€t des Benutzers ĂŒber einen lokalen Inferenz-Stack. Dies reduziert die AbhĂ€ngigkeit von der Cloud und ermöglicht die Nutzung ohne Netzwerk nach der Installation der Modelle.

  • Private Audioverarbeitung. Das Mikrofon wird nur wĂ€hrend der Benutzersitzung aktiviert. Audio sollte standardmĂ€ĂŸig nicht auf die Festplatte aufgezeichnet werden, ein begrenzter Speicherpuffer wird verwendet, der nach Abschluss der Sitzung gelöscht wird.

  • Visueller AktivitĂ€tsindikator. WĂ€hrend der Aufnahme und Transkription sollte der Benutzer einen verstĂ€ndlichen Statusindikator sehen. In der Spezifikation werden Status wie Aufzeichnung, Transkription, Finalisierung und Fehler erwĂ€hnt.

  • EinfĂŒgen von stabilen Texten. Bei der ersten Implementierung sollten Zwischenhypothesen der Erkennung nicht direkt in die Anwendung eingefĂŒgt werden. Nur der bestĂ€tigte endgĂŒltige Text wird ins Zielfeld gesendet.

  • Nachbearbeitung des Textes. Die rohe Transkription kann normalisiert, mit Interpunktion versehen, kapitalisiert, formatiert und mĂŒndliche Formen in schriftliche umgewandelt werden, zum Beispiel "twenty two" → "22".

  • Auswahl der Sprache fĂŒr die Diktierung. Das System sollte eine anpassbare Diktatsprache unterstĂŒtzen, wobei standardmĂ€ĂŸig die Sprache der BenutzeroberflĂ€che verwendet wird, sofern ein passendes Modell verfĂŒgbar ist.

  • ModelqualitĂ€tsprofile. Die Spezifikation sieht verschiedene Modellprofile vor: eine leichtgewichtige Variante mit geringeren Ressourcenanforderungen, ein ausgewogenes Standardprofil und eine qualitativ hochwertigere, aber ressourcenintensivere Variante.

  • Sichere Verarbeitung des Eingabefokus. Das Ziel fĂŒr das EinfĂŒgen von Text wird zu Beginn der Sitzung ausgewĂ€hlt. Wenn sich der Fensterfokus wĂ€hrend der Diktation Ă€ndert, sollte das System den Text nicht stillschweigend in eine andere Anwendung senden.

  • Sperrung in geschĂŒtzten Feldern. Die Diktation sollte in Passwortfeldern, Authentifizierungsfenstern und anderen geschĂŒtzten Bereichen blockiert werden, sofern die Anwendung oder das Toolkit dies zulĂ€sst.

  • Integration mit Wayland/GNOME. Die erste Version ist auf Wayland und GNOME ausgerichtet. FĂŒr die anfĂ€ngliche Texteingabe wird IBus in Betracht gezogen, und in Zukunft ist ein nativere Weg ĂŒber Input-Methode/Text-Eingabe-Protokolle geplant.

  • Benutzereinstellungen. In der geplanten EinstellungsoberflĂ€che sollten die Aktivierung/deaktivierung von STT, die Auswahl der Tastenkombination, der Diktier-Sprache, des Mikrofons, des Modellprofils, der Nachbearbeitungsoptionen und des AktivitĂ€tsindikators enthalten sein.

In der ersten Iteration bleiben außerhalb des Projekts die SchlĂŒsselphrase-Wachsamkeit, stĂ€ndiges Hintergrund-Listening, Cloud-Spracherkennung, Sprachassistent, Sprachbefehle, Desktop-Verwaltung, SprachĂŒbersetzung, Sprechererkennung, automatische Spracherkennung und Diktierhistorie zurĂŒck. Mit anderen Worten, Canonical beginnt nicht mit einem "AI-Assistenten", sondern mit einer bodenstĂ€ndigeren Funktion: lokaler Spracherkennung fĂŒr die Texteingabe in regulĂ€re Ubuntu-Anwendungen.

Quelle: linux.org.ru

ZuverlĂ€ssiges Hosting fĂŒr Websites mit DDoS-Schutz kaufen, VPS VDS Server đŸ”„ ZuverlĂ€ssiges Hosting fĂŒr Websites mit DDoS-Schutz kaufen, VPS VDS Server - ProHoster