Washingtoni, Illinoisi ja Chicagos asuvate teadlaste rühm avastas uue meetodi ohtliku sisu töötlemise piirangute ületamiseks AI-chatbotides, mis põhinevad suurte keelemudelite (LLM) tehnoloogial. Rünnak põhineb asjaolul, et keelemudelid GPT-3.5, GPT-4 (OpenAI), Gemini (Google), Claude (Anthropic) ja Llama2 (Meta) tuvastavad ja arvestavad päringutes teksti, mis on esitatud ASCII-graafikana. Seega piisab filtreerimise tõkete ületamiseks keelatud sõnade esitamisest ASCII-pildina.


Efektiivsuse poolest ületab uus rünnaku meetod oluliselt teisi tuntud viise chatbotide filtrite ületamiseks. Kõrgeim ASCII-graafika tuvastamise kvaliteet on registreeritud mudelites Gemini, GPT-4 ja GPT-3.5, mille testimisel oli kontrollpäringute (HPR, Useful Rate, päringu töötlemise edukuse koefitsient) edukuse tase vastavalt 100%, 98% ja 92%, rünnaku edukuse määr (ASR, Attack Success Rate) 76%, 32% ja 76%, ning saadud vastuste ohtlikkuse tase (HS, Harmfulness Score) viiepallisel skaalal 4.42, 3.38 ja 4.56 punkti.


Teadlased näitasid ka, et praegu levinud kaitsemeetodid filtrite vältimise vastu (PPL, Parafraseerimine ja Retokeniseerimine) ei ole ArtPrompt rünnaku blokeerimiseks efektiivsed. Veelgi enam, retokeniseerimise meetodi kasutamine suurendas isegi edukalt käsitletud päringute arvu.

Lisainfo: Yandex GPT2 vastab samuti suurepäraselt küsimustele, mis sisaldavad ASCII-graafikat. Näide sõnaga „HELLO“:

Allikas: opennet.ru
