Google hat ein Experiment zur Integration eines großen Sprachmodells für maschinelles Lernen in Chrome angekündigt. Um auf das Modell aus Webanwendungen und Browsererweiterungen zuzugreifen, wurde die API Prompt vorgeschlagen, die es ermöglicht, Anfragen in natürlicher Sprache zu senden, ähnlich den Chatbots. Es wird angenommen, dass das integrierte Sprachmodell im Browser die Durchführung von KI-Aufgaben in Webanwendungen erleichtert und die Notwendigkeit für die Installation und Verwaltung von Sprachmodellen beseitigt.
Im laufenden Experiment wird das Modell Gemini Nano eingesetzt, das kompakteste aus der Gemini-Familie. Außerdem gibt es die Möglichkeit, Expertenmodelle zu installieren, die das Basismodell mit zusätzlichen Kenntnissen erweitern, die zur Lösung spezifischer Aufgaben erforderlich sein könnten, sowie zur Umsetzung von Fähigkeiten wie maschinelle Übersetzung und Zusammenfassung. Die Modelle werden lokal auf dem System des Benutzers ohne Zugriff auf externe Dienste ausgeführt.
Das zur Ausführung von Runtime-Modellen genutzte System aktiviert automatisch die verfügbaren GPUs und NPUs, um die Leistung des Modells zu steigern, oder wechselt zur Ausführung des Modells auf dem CPU. Zu den Vorteilen der Ausführung des Modells auf dem Nutzergerät gehört die Wahrung der Vertraulichkeit der verarbeiteten Daten, die Möglichkeit, im Offline-Modus zu arbeiten, wenn keine Netzwerkverbindung besteht oder bei Problemen mit der Verbindungsqualität, die Reduzierung von Verzögerungen bei der Anforderung von Anfragen sowie die Unabhängigkeit von externen Diensten.

Die entwickelbare API Prompt ermöglicht nicht nur die Durchführung einfacher Einzelanfragen in natürlicher Sprache, sondern organisiert auch die Einbeziehung des Modells zur Verarbeitung und Klassifizierung von Daten unter Berücksichtigung des Kontexts. Sie berücksichtigt dabei zuvor im Sitzungsgespräch gesendete Anfragen und Daten und nutzt das Modell zur Auswahl optimaler Optionen (zum Beispiel kann man darum bitten, ein Emoji aus einer Liste für einen bestimmten Kommentar auf der Website auszuwählen). Darüber hinaus ist eine Weiterentwicklung der API für den Einsatz im Bereich der Content-Erstellung geplant, um Aufgaben wie das Umschreiben in anderen Worten, Korrekturlesen und Grammatiküberprüfung zu lösen.
Im Allgemeinen werden zwei Arten von APIs entwickelt, um mit dem integrierten KI-Modell zu interagieren: Task API und Exploratory API. Die erste bietet Zugang zu Funktionen zur Lösung spezifischer Aufgaben, wie zum Beispiel der Übersetzung von Texten von einer Sprache in eine andere (API Translation) oder der Zusammenfassung des Wesentlichen eines Textes (API Summarization). Die zweite Art konzentriert sich auf die Erstellung und Überprüfung experimenteller Prototypen bei der Entwicklung neuer Task APIs. Außerdem wird an der API LoRA (Low-Rank Adaptation) gearbeitet, um die Gewichtung der Basismodelle anzupassen und die Effizienz bei der Lösung bestimmter Aufgaben zu verbessern.
Der Zugang zur Teilnahme am Experiment wird nach Einreichung eines Antrags gewährt. Die API befindet sich in aktiver Entwicklung und wird vor der endgültigen Version anhand des Feedbacks und der Präferenzen der Benutzer erweitert und verändert. Zukünftig ist geplant, zugänglichere Tests mit dem Origin Trials-Modus zu organisieren, der die Verwendung experimenteller APIs aus Anwendungen, die von localhost oder 127.0.0.1 geladen werden, oder nach Registrierung und Erhalt eines speziellen Tokens ermöglicht, das für eine bestimmte Webseite zeitlich begrenzt gültig ist. Parallel wird mit anderen Browserherstellern an der Standardisierung der entwickelten APIs gearbeitet.
Quelle: opennet.ru
