ArtPrompt — une attaque contre les systèmes AI, permettant de contourner les filtres à l'aide d'images ASCII

Un groupe de chercheurs des universités de Washington, d'Illinois et de Chicago a découvert une nouvelle méthode pour contourner les restrictions sur le traitement du contenu dangereux dans les chatbots IA basés sur de grands modèles linguistiques (LLM). L'attaque repose sur le fait que les modèles linguistiques GPT-3.5, GPT-4 (OpenAI), Gemini (Google), Claude (Anthropic) et Llama2 (Meta) reconnaissent et prennent en compte dans leurs requêtes du texte présenté sous forme d'art ASCII. Ainsi, pour contourner les filtres sur des questions dangereuses, il suffit de présenter des mots interdits sous forme d'image ASCII.

ArtPrompt - une attaque contre les systèmes d'IA permettant de contourner les filtres à l'aide d'images ASCII
ArtPrompt - une attaque contre les systèmes d'IA permettant de contourner les filtres à l'aide d'images ASCII

En termes d'efficacité, cette nouvelle méthode d'attaque a significativement surpassé d'autres méthodes connues de contournement des filtres dans les chatbots. La meilleure qualité de reconnaissance de l'art ASCII a été enregistrée dans les modèles Gemini, GPT-4 et GPT-3.5, avec un taux de contournement des filtres vérifiés (HPR, Helpful Rate) évalué à 100%, 98% et 92% lors des tests, un taux de succès de l'attaque (ASR, Attack Success Rate) de 76%, 32% et 76%, et un niveau de dangerosité des réponses obtenues (HS, Harmfulness Score) sur une échelle de cinq points de 4.42, 3.38 et 4.56, respectivement.

ArtPrompt - une attaque contre les systèmes d'IA permettant de contourner les filtres à l'aide d'images ASCII
ArtPrompt - une attaque contre les systèmes d'IA permettant de contourner les filtres à l'aide d'images ASCII

Les chercheurs ont également démontré que les méthodes de protection actuellement en vigueur contre le contournement des filtres (PPL, Paraphrase et Retokenization) sont inefficaces pour bloquer l'attaque ArtPrompt. De plus, l'utilisation de la méthode Retokenization a même augmenté le nombre de requêtes traitées avec succès.

ArtPrompt - une attaque contre les systèmes d'IA permettant de contourner les filtres à l'aide d'images ASCII

À noter : Yandex GPT2 répond également très bien aux questions comportant de l'art ASCII. Exemple avec le mot « HELLO » :

ArtPrompt - une attaque contre les systèmes d'IA permettant de contourner les filtres à l'aide d'images ASCII


Source : opennet.ru
Acheter un hébergement fiable pour les sites avec protection DDoS, serveurs VPS VDS 🔥 Acheter un hébergement fiable pour les sites avec protection DDoS, serveurs VPS VDS | ProHoster