Washingtoni, Illinois ja Chicago ülikoolide teadlaste rühm avastas uue meetodi, mis võimaldab ringi minna AI-vestlusrobotites ohtliku sisu töötlemise piirangutest, mis põhinevad suurte keelemudelite (LLM) kasutamisel. Rünnak põhineb asjaolul, et GPT-3.5, GPT-4 (OpenAI), Gemini (Google), Claude (Anthropic) ja Llama2 (Meta) keelemudelid suudavad tuvastada ja arvesse võtta päringutes teksti, mis on esitatud ASCII-graafika kujul. Seega piisas ohtlike küsimuste filtritest mööda pääsemiseks keelatud sõnade esitamises ASCII-pildina.


Uue rünnakumeetodi tõhusus ületab märgatavalt teisi tuntud viise vestlusrobotite filtritest mööda pääsemiseks. Kõrgeim ASCII-graafika tuvastamise kvaliteet on fikseeritud mudelites Gemini, GPT-4 ja GPT-3.5, mille kontrollpäringutes (HPR, abistav määr, päringu töötlemise õnnestumise koefitsient) hind, mille tulemused on 100%, 98% ja 92%, rünnaku õnnestumise määr (ASR, rünnaku õnnestumise määr) 76%, 32% ja 76%, samal ajal kui saadud vastuste ohtlikkuse tase (HS, kahjulikkus skoor) viiepallisüsteemis on vastavalt 4.42, 3.38 ja 4.56 punkti.


Uurijad on samuti näidanud, et praegu levinud kaitsemeetodid filtreerimise ümbersuunamise vastu (PPL, Parafraas ja Retokenization) ei ole ArtPrompt rünnaku blokeerimisel tõhusad. Veelgi enam, Retokenization meetodi kasutamine on isegi suurendanud edukalt töödeldud päringute arvu.

Täiendav info: Yandex GPT2 vastab samuti suurepäraselt küsimustele, mis sisaldavad ASCII-graafikat. Näide sõnast «HELLO»:

Allikas: opennet.ru
