Një grup hulumtuesish nga Universiteti i Washingtonit, Universiteti i Illinoisit dhe Universiteti i Çikagos ka zbuluar një metodë të re për të anashkaluar kufizimet në përpunimin e përmbajtjeve të rrezikshme në AI chatbotë, të ndërtuar mbi modelet e mëdha gjuhësore (LLM). Sulmi bazohet në fakti se modelet gjuhësore GPT-3.5, GPT-4 (OpenAI), Gemini (Google), Claude (Anthropic) dhe Llama2 (Meta) njihen dhe marrin në konsideratë në kërkesat e tyre tekstin e paraqitur si grafikë ASCII. Kështu, për të anashkaluar filtrat e pyetjeve të rrezikshme, mjaftonte të tregohet fjalë e ndaluar në formën e një imazhi ASCII.


Sa i përket efektivitetit, metoda e re e sulmit ka tejkaluar ndjeshëm metodat e njohura për anashkalimin e filtrave në chatbotë. Cilësia më e lartë e njohjes së grafikës ASCII është vënë re në modelet Gemini, GPT-4 dhe GPT-3.5, me nivelin e anashkalimit të suksesshëm të filtrave nga kërkesat testuese (HPR, Koeficienti i Pëlqyeshmërisë, koeficienti i suksesit të përpunimit të kërkesave) e cila është vlerësuar në 100%, 98% dhe 92%, niveli i suksesit të realizimit të sulmit (ASR, Koeficienti i Suksesit të Sulmit) në 76%, 32% dhe 76%, dhe niveli i rrezikshmërisë së përgjigjeve të marra (HS, Skor Rrezikshmëri) në një shkallë prej pesë pikësh në 4.42, 3.38 dhe 4.56 pikë, përkatësisht.


Hulumtuesit gjithashtu demonstruan se metodat aktualisht të njohura të mbrojtjes nga anashkalimi i filtrave (PPL, Parafrazim dhe Retokenizim) janë joefektive për bllokimin e sulmit ArtPrompt. Më shumë, përdorimi i metodës Retokenizim madje rriti numrin e kërkesave të përpunuara me sukses.

Shtesë: Yandex GPT2 gjithashtu përgjigjet mjaft mirë në pyetje me grafikë ASCII. Një shembull me fjalën "HELLO":

Burimi: opennet.ru
