Un groupe de chercheurs des universités de Washington, d'Illinois et de Chicago a découvert une nouvelle méthode pour contourner les restrictions sur le traitement du contenu dangereux dans les chatbots IA basés sur de grands modèles linguistiques (LLM). L'attaque repose sur le fait que les modèles linguistiques GPT-3.5, GPT-4 (OpenAI), Gemini (Google), Claude (Anthropic) et Llama2 (Meta) reconnaissent et prennent en compte dans leurs requêtes du texte présenté sous forme d'art ASCII. Ainsi, pour contourner les filtres sur des questions dangereuses, il suffit de présenter des mots interdits sous forme d'image ASCII.


En termes d'efficacité, cette nouvelle méthode d'attaque a significativement surpassé d'autres méthodes connues de contournement des filtres dans les chatbots. La meilleure qualité de reconnaissance de l'art ASCII a été enregistrée dans les modèles Gemini, GPT-4 et GPT-3.5, avec un taux de contournement des filtres vérifiés (HPR, Helpful Rate) évalué à 100%, 98% et 92% lors des tests, un taux de succès de l'attaque (ASR, Attack Success Rate) de 76%, 32% et 76%, et un niveau de dangerosité des réponses obtenues (HS, Harmfulness Score) sur une échelle de cinq points de 4.42, 3.38 et 4.56, respectivement.


Les chercheurs ont également démontré que les méthodes de protection actuellement en vigueur contre le contournement des filtres (PPL, Paraphrase et Retokenization) sont inefficaces pour bloquer l'attaque ArtPrompt. De plus, l'utilisation de la méthode Retokenization a même augmenté le nombre de requêtes traitées avec succès.

À noter : Yandex GPT2 répond également très bien aux questions comportant de l'art ASCII. Exemple avec le mot « HELLO » :

Source : opennet.ru
