ArtPrompt — sulm ndaj sistemeve AI qĂ« lejon anashkalimin e filtrave me ndihmĂ«n e figurave ASCII

Një grup hulumtuesish nga Universiteti i Washington-it, Universiteti i Illinois-it dhe Universiteti i Chicagos identifikoi një metodë të re për të anashkaluar kufizimet në përpunimin e përmbajtjes së rrezikshme në chatbotët AI të ndërtuar mbi modelet e mëdha të gjuhës (LLM). Sulmi bazohet në faktin se modelet gjuhësore GPT-3.5, GPT-4 (OpenAI), Gemini (Google), Claude (Anthropic) dhe Llama2 (Meta) njohin me sukses dhe marrin parasysh në kërkesat tekstin e formuar si grafikë ASCII. Kështu, për të anashkaluar filtrat e pyetjeve të rrezikshme, mjafton që të indikohen fjalët e ndaluara në formën e një imazhi ASCII.

ArtPrompt - një sulm ndaj sistemeve AI që lejon anashkalimin e filtrave përmes imazheve ASCII
ArtPrompt - një sulm ndaj sistemeve AI që lejon anashkalimin e filtrave përmes imazheve ASCII

Në efektivitetin e saj, metoda e re e sulmit tejkalon dukshëm mënyrat e tjera të njohura për anashkalimin e filtrave në chatbotë. Cilësia më e lartë e njohjes së grafikës ASCII është regjistruar në modelet Gemini, GPT-4 dhe GPT-3.5, niveli i anashkalimit të filtrave me kërkesat testuese (HPR, Helpful Rate, koeficienti i suksesshëm i trajtimit të kërkesës) në të cilat është vlerësuar në 100%, 98% dhe 92%, shkalla e suksesit të kryerjes së sulmit (ASR, Attack Success Rate) në 76%, 32% dhe 76%, ndërsa niveli i rrezikshmërisë së përgjigjeve të marra (HS, Harmfulness Score) mbi një shkallë prej pesë pikësh në 4.42, 3.38 dhe 4.56 pikë, përkatësisht.

ArtPrompt - një sulm ndaj sistemeve AI që lejon anashkalimin e filtrave përmes imazheve ASCII
ArtPrompt - një sulm ndaj sistemeve AI që lejon anashkalimin e filtrave përmes imazheve ASCII

Hulumtuesit gjithashtu treguan se metodat aktuale të mbrojtjes kundër anashkalimit të filtrave (PPL, Paraphrase dhe Retokenization) janë të paefektshme për bllokimin e sulmit ArtPrompt. Më tepër, përdorimi i metodës Retokenization ka rritur madje numrin e kërkesave të trajtuara me sukses.

ArtPrompt - një sulm ndaj sistemeve AI që lejon anashkalimin e filtrave përmes imazheve ASCII

Shtesë: Yandex GPT2 gjithashtu përgjigjet shkëlqyeshëm ndaj pyetjeve me grafikë ASCII. Një shembull me fjalën "HELLO":

ArtPrompt - një sulm ndaj sistemeve AI që lejon anashkalimin e filtrave përmes imazheve ASCII


Burimi: opennet.ru
Blini hosting tĂ« besueshĂ«m pĂ«r faqe interneti me mbrojtje nga DDoS, serverĂ« VPS VDS đŸ”„ Blini hosting tĂ« besueshĂ«m pĂ«r faqe interneti me mbrojtje nga DDoS, serverĂ« VPS VDS | ProHoster