ArtPrompt — sulm mbi sistemet AI, duke lejuar kalimin e filtrave përmes figurash ASCII

Një grup hulumtuesish nga Universiteti i Washingtonit, Universiteti i Illinoisit dhe Universiteti i Çikagos ka zbuluar një metodë të re për të anashkaluar kufizimet në përpunimin e përmbajtjeve të rrezikshme në AI chatbotë, të ndërtuar mbi modelet e mëdha gjuhësore (LLM). Sulmi bazohet në fakti se modelet gjuhësore GPT-3.5, GPT-4 (OpenAI), Gemini (Google), Claude (Anthropic) dhe Llama2 (Meta) njihen dhe marrin në konsideratë në kërkesat e tyre tekstin e paraqitur si grafikë ASCII. Kështu, për të anashkaluar filtrat e pyetjeve të rrezikshme, mjaftonte të tregohet fjalë e ndaluar në formën e një imazhi ASCII.

ArtPrompt - një sulm mbi sistemet AI, që lejon anashkalimin e filtrave duke përdorur imazhe ASCII.
ArtPrompt - një sulm mbi sistemet AI, që lejon anashkalimin e filtrave duke përdorur imazhe ASCII.

Sa i përket efektivitetit, metoda e re e sulmit ka tejkaluar ndjeshëm metodat e njohura për anashkalimin e filtrave në chatbotë. Cilësia më e lartë e njohjes së grafikës ASCII është vënë re në modelet Gemini, GPT-4 dhe GPT-3.5, me nivelin e anashkalimit të suksesshëm të filtrave nga kërkesat testuese (HPR, Koeficienti i Pëlqyeshmërisë, koeficienti i suksesit të përpunimit të kërkesave) e cila është vlerësuar në 100%, 98% dhe 92%, niveli i suksesit të realizimit të sulmit (ASR, Koeficienti i Suksesit të Sulmit) në 76%, 32% dhe 76%, dhe niveli i rrezikshmërisë së përgjigjeve të marra (HS, Skor Rrezikshmëri) në një shkallë prej pesë pikësh në 4.42, 3.38 dhe 4.56 pikë, përkatësisht.

ArtPrompt - një sulm mbi sistemet AI, që lejon anashkalimin e filtrave duke përdorur imazhe ASCII.
ArtPrompt - një sulm mbi sistemet AI, që lejon anashkalimin e filtrave duke përdorur imazhe ASCII.

Hulumtuesit gjithashtu demonstruan se metodat aktualisht të njohura të mbrojtjes nga anashkalimi i filtrave (PPL, Parafrazim dhe Retokenizim) janë joefektive për bllokimin e sulmit ArtPrompt. Më shumë, përdorimi i metodës Retokenizim madje rriti numrin e kërkesave të përpunuara me sukses.

ArtPrompt - një sulm mbi sistemet AI, që lejon anashkalimin e filtrave duke përdorur imazhe ASCII.

Shtesë: Yandex GPT2 gjithashtu përgjigjet mjaft mirë në pyetje me grafikë ASCII. Një shembull me fjalën "HELLO":

ArtPrompt - një sulm mbi sistemet AI, që lejon anashkalimin e filtrave duke përdorur imazhe ASCII.


Burimi: opennet.ru
Bleni hostim të besueshëm për faqe me mbrojtje nga DDoS, serverë VPS VDS 🔥 Bleni hostim të besueshëm për faqe me mbrojtje nga DDoS, serverë VPS VDS | ProHoster