Firma Google ogłosiła przeprowadzenie eksperymentu polegającego na wbudowaniu dużego modelu językowego uczenia maszynowego w przeglądarkę Chrome. Aby uzyskać dostęp do modelu z aplikacji internetowych i rozszerzeń przeglądarki, zaproponowano API Prompt, które umożliwia przesyłanie zapytań w języku naturalnym, podobnie jak w przypadku chatbotów. Zakłada się, że wbudowany w przeglądarkę duży model językowy uprości realizację zadań AI w aplikacjach webowych i umożliwi korzystanie bez konieczności instalacji i zarządzania modelami językowymi.
W przeprowadzanym eksperymencie używana jest model Gemini Nano, najbardziej kompaktowy z rodziny Gemini. Przewidziano również możliwość instalacji modeli eksperckich, które rozszerzają podstawowy model o dodatkową wiedzę, która może być potrzebna do rozwiązania specyficznych zadań, a także do realizacji umiejętności, takich jak tłumaczenie maszynowe i podsumowywanie. Modele są uruchamiane lokalnie na systemie użytkownika, bez kontaktu z zewnętrznymi usługami.
Stosowany do uruchamiania modelu Runtime automatycznie wykorzystuje dostępne w systemie GPU i NPU, aby przyspieszyć pracę z modelem lub przełącza się na wykonywanie modelu z wykorzystaniem CPU. Do zalet uruchamiania modelu na systemie użytkownika należy zachowanie poufności przetwarzanych danych, możliwość kontynuacji pracy w trybie offline w przypadku braku połączenia sieciowego lub problemów z jakością połączenia, zmniejszenie opóźnień przy wysyłaniu zapytań oraz wykluczenie zależności od zewnętrznych usług.

Rozwijane w celu interakcji z modelem API Prompt pozwala nie tylko na realizację najprostszych pojedynczych zapytań w języku naturalnym, ale także na organizowanie współpracy modelu przy przetwarzaniu i klasyfikacji danych z uwzględnieniem kontekstu, branie pod uwagę wcześniejszych zapytań i danych wysłanych w sesji oraz korzystanie z modelu do wyboru optymalnych opcji (na przykład można poprosić o wybór ikony z listy emoji dla danego komentarza na stronie). Dodatkowo planowane jest rozwijanie API do wykorzystania w obszarze tworzenia treści i rozwiązywania takich zadań, jak przepisywanie innymi słowami, korekta i poprawa gramatyki.
W ogólnym ujęciu do interakcji z wbudowanym modelem AI rozwija się dwa typy API — Task i Exploratory. Pierwszy zapewnia dostęp do możliwości rozwiązywania określonych zadań, takich jak tłumaczenie tekstu z jednego języka na inny (API Translation) lub podsumowanie głównych idei tekstu (API Summarization). Drugi typ jest skierowany na tworzenie i weryfikację eksperymentalnych prototypów podczas rozwijania nowych API Task. Trwają również prace nad API LoRA (Low-Rank Adaptation) w celu dostosowania wag podstawowego modelu w celu zwiększenia efektywności rozwiązywania określonych zadań.
Dostęp do udziału w eksperymencie jest przyznawany po wypełnieniu formularza zgłoszeniowego. API jest w aktywnym rozwoju i do momentu przyjęcia ostatecznej wersji będzie się rozszerzać i zmieniać w zależności od opinii i preferencji użytkowników. W przyszłości planowane jest zorganizowanie bardziej dostępnego testowania z użyciem trybu Origin Trials, który umożliwia pracę z eksperymentalnymi API z aplikacji ładowanych z localhost lub 127.0.0.1, lub po rejestracji i uzyskaniu specjalnego tokena, który działa ograniczony czas dla konkretnej witryny. Równolegle z producentami innych przeglądarek prowadzone są prace nad standaryzacją rozwijanych API.
Źródło: opennet.ru
