ArtPrompt — attacco ai sistemi AI, permesso di eludere i filtri utilizzando immagini ASCII

Un gruppo di ricercatori delle università di Washington, Illinois e Chicago ha rivelato un nuovo metodo per bypassare le restrizioni sul trattamento dei contenuti pericolosi nei chatbot AI basati su modelli linguistici di grandi dimensioni (LLM). L'attacco si basa sul fatto che i modelli linguistici GPT-3.5, GPT-4 (OpenAI), Gemini (Google), Claude (Anthropic) e Llama2 (Meta) riconoscono e considerano con successo nelle loro richieste il testo formattato come arte ASCII. Pertanto, per bypassare i filtri delle domande pericolose, è stato sufficiente indicare le parole vietate sotto forma di immagini ASCII.

ArtPrompt - attacco ai sistemi AI che consente di bypassare i filtri utilizzando immagini ASCII.
ArtPrompt - attacco ai sistemi AI che consente di bypassare i filtri utilizzando immagini ASCII.

Per la sua efficacia, il nuovo metodo di attacco ha superato di gran lunga altri noti modi per eludere i filtri nei chatbot. La qualità di riconoscimento dell'arte ASCII più elevata è stata registrata nei modelli Gemini, GPT-4 e GPT-3.5, con un livello di bypass dei filtri attraverso richieste di verifica (HPR, Helpful Rate, coefficiente di elaborazione riuscita della richiesta) valutato rispettivamente al 100%, 98% e 92%, un tasso di successo dell'attacco (ASR, Attack Success Rate) del 76%, 32% e 76%, e un livello di pericolosità delle risposte ottenute (HS, Harmfulness Score) su una scala da 1 a 5 rispettivamente di 4.42, 3.38 e 4.56.

ArtPrompt - attacco ai sistemi AI che consente di bypassare i filtri utilizzando immagini ASCII.
ArtPrompt - attacco ai sistemi AI che consente di bypassare i filtri utilizzando immagini ASCII.

I ricercatori hanno anche dimostrato che i metodi di difesa attualmente utilizzati per bloccare il bypass dei filtri (PPL, Paraphrase e Retokenization) non sono efficaci contro l'attacco ArtPrompt. Inoltre, l'uso del metodo Retokenization ha persino aumentato il numero di richieste elaborate con successo.

ArtPrompt - attacco ai sistemi AI che consente di bypassare i filtri utilizzando immagini ASCII.

Nota: Yandex GPT2 risponde anche molto bene a domande con arte ASCII. Esempio con la parola "HELLO":

ArtPrompt - attacco ai sistemi AI che consente di bypassare i filtri utilizzando immagini ASCII.


Fonte: opennet.ru
Acquista hosting affidabile per siti web con protezione DDoS, VPS VDS server 🔥 Acquista hosting affidabile per siti web con protezione DDoS, VPS VDS server | ProHoster