ArtPrompt — atac asupra sistemelor AI care permite ocolirea filtrelor prin imagini ASCII.

Un grup de cercetători de la Universitatea din Washington, Universitatea din Illinois și Universitatea din Chicago a identificat o nouă metodă de ocolire a restricțiilor privind procesarea conținutului periculos în chatbot-uri AI bazate pe modele lingvistice mari (LLM). Atacul se bazează pe faptul că modelele lingvistice GPT-3.5, GPT-4 (OpenAI), Gemini (Google), Claude (Anthropic) și Llama2 (Meta) recunosc și iau în considerare în cereri textul format în grafică ASCII. Astfel, pentru a ocoli filtrele întrebărilor periculoase, a fost suficient să specificăm cuvintele interzise sub formă de imagine ASCII.

ArtPrompt - atac asupra sistemelor AI, care permite ocolirea filtrelor prin intermediul imaginilor ASCII
ArtPrompt - atac asupra sistemelor AI, care permite ocolirea filtrelor prin intermediul imaginilor ASCII

În termeni de eficiență, noua metodă de atac a depășit semnificativ alte metode cunoscute de ocolire a filtrelor în chatbot-uri. Cele mai bune rezultate de recunoaștere a graficii ASCII au fost înregistrate în modelele Gemini, GPT-4 și GPT-3.5, iar nivelul de succes al ocolirii filtrelor prin cereri de testare (HPR, Helpful Rate, coeficientul de procesare a cererilor) a fost evaluat la 100%, 98% și 92%, respectiv, rata de succes a atacului (ASR, Attack Success Rate) la 76%, 32% și 76%, iar nivelul de periculozitate al răspunsurilor obținute (HS, Harmfulness Score) pe o scară de cinci puncte a fost de 4.42, 3.38 și 4.56 puncte, respectiv.

ArtPrompt - atac asupra sistemelor AI, care permite ocolirea filtrelor prin intermediul imaginilor ASCII
ArtPrompt - atac asupra sistemelor AI, care permite ocolirea filtrelor prin intermediul imaginilor ASCII

Cercetătorii au demonstrat de asemenea că metodele de protecție utilizate în prezent pentru a bloca ocolirea filtrelor (PPL, Paraphrase și Retokenization) sunt ineficiente împotriva atacului ArtPrompt. Mai mult, utilizarea metodei Retokenization a crescut chiar numărul cererilor procesate cu succes.

ArtPrompt - atac asupra sistemelor AI, care permite ocolirea filtrelor prin intermediul imaginilor ASCII

Notă: Yandex GPT2 răspunde de asemenea foarte bine la întrebările cu grafică ASCII. Exemplu cu cuvântul „HELLO”:

ArtPrompt - atac asupra sistemelor AI, care permite ocolirea filtrelor prin intermediul imaginilor ASCII


Sursa: opennet.ro
Cumpără un hosting fiabil pentru site-uri cu protecție DDoS, servere VPS VDS 🔥 Cumpără un hosting fiabil pentru site-uri cu protecție DDoS, servere VPS VDS | ProHoster