Një grup hulumtuesish nga Universiteti i Washington-it, Universiteti i Illinois-it dhe Universiteti i Chicagos identifikoi një metodë të re për të anashkaluar kufizimet në përpunimin e përmbajtjes së rrezikshme në chatbotët AI të ndërtuar mbi modelet e mëdha të gjuhës (LLM). Sulmi bazohet në faktin se modelet gjuhësore GPT-3.5, GPT-4 (OpenAI), Gemini (Google), Claude (Anthropic) dhe Llama2 (Meta) njohin me sukses dhe marrin parasysh në kërkesat tekstin e formuar si grafikë ASCII. Kështu, për të anashkaluar filtrat e pyetjeve të rrezikshme, mjafton që të indikohen fjalët e ndaluara në formën e një imazhi ASCII.


Në efektivitetin e saj, metoda e re e sulmit tejkalon dukshëm mënyrat e tjera të njohura për anashkalimin e filtrave në chatbotë. Cilësia më e lartë e njohjes së grafikës ASCII është regjistruar në modelet Gemini, GPT-4 dhe GPT-3.5, niveli i anashkalimit të filtrave me kërkesat testuese (HPR, Helpful Rate, koeficienti i suksesshëm i trajtimit të kërkesës) në të cilat është vlerësuar në 100%, 98% dhe 92%, shkalla e suksesit të kryerjes së sulmit (ASR, Attack Success Rate) në 76%, 32% dhe 76%, ndërsa niveli i rrezikshmërisë së përgjigjeve të marra (HS, Harmfulness Score) mbi një shkallë prej pesë pikësh në 4.42, 3.38 dhe 4.56 pikë, përkatësisht.


Hulumtuesit gjithashtu treguan se metodat aktuale të mbrojtjes kundër anashkalimit të filtrave (PPL, Paraphrase dhe Retokenization) janë të paefektshme për bllokimin e sulmit ArtPrompt. Më tepër, përdorimi i metodës Retokenization ka rritur madje numrin e kërkesave të trajtuara me sukses.

Shtesë: Yandex GPT2 gjithashtu përgjigjet shkëlqyeshëm ndaj pyetjeve me grafikë ASCII. Një shembull me fjalën "HELLO":

Burimi: opennet.ru
