ArtPrompt — eine Attacke auf KI-Systeme, die die Filter durch ASCII-Bilder umgeht

Eine Gruppe von Forschern der Universitäten Washington, Illinois und Chicago hat eine neue Methode entdeckt, um die Einschränkungen bei der Verarbeitung von gefährlichem Inhalt in KI-Chatbots, die auf großen Sprachmodellen (LLM) basieren, zu umgehen. Der Angriff basiert darauf, dass die Sprachmodelle GPT-3.5, GPT-4 (OpenAI), Gemini (Google), Claude (Anthropic) und Llama2 (Meta) erfolgreich Text erkennen und in den Anfragen berücksichtigen, der als ASCII-Grafik formatiert ist. Somit war es ausreichend, verbotene Wörter in Form von ASCII-Bildern anzugeben, um die Filter gefährlicher Fragen zu umgehen.

ArtPrompt - ein Angriff auf KI-Systeme, der es ermöglicht, die Filter unter Verwendung von ASCII-Bildern zu umgehen.
ArtPrompt - ein Angriff auf KI-Systeme, der es ermöglicht, die Filter unter Verwendung von ASCII-Bildern zu umgehen.

In Bezug auf die Effizienz übertrifft die neue Angriffsmethode deutlich andere bekannte Möglichkeiten, die Filter in Chatbots zu umgehen. Die höchste Qualität der Erkennung von ASCII-Grafiken wurde bei den Modellen Gemini, GPT-4 und GPT-3.5 festgestellt, wobei die Erfolgsrate beim Umgehen der Filter (HPR, Helpful Rate, erfolgreicher Anfragebearbeitungskoeffizient) in den Tests bei 100%, 98% und 92% lag, die Angriffserfolgsrate (ASR, Attack Success Rate) bei 76%, 32% und 76% und die Gefährlichkeit der erhaltenen Antworten (HS, Harmfulness Score) auf einer Skala von fünf Punkten bei 4.42, 3.38 und 4.56 Punkten, entsprechend.

ArtPrompt - ein Angriff auf KI-Systeme, der es ermöglicht, die Filter unter Verwendung von ASCII-Bildern zu umgehen.
ArtPrompt - ein Angriff auf KI-Systeme, der es ermöglicht, die Filter unter Verwendung von ASCII-Bildern zu umgehen.

Die Forscher haben auch gezeigt, dass die derzeit verbreiteten Schutzmethoden gegen das Umgehen von Filtern (PPL, Paraphrase und Retokenization) ineffektiv sind, um den ArtPrompt-Angriff zu blockieren. Darüber hinaus erhöhte die Verwendung der Methode Retokenization sogar die Anzahl der erfolgreich verarbeiteten Anfragen.

ArtPrompt - ein Angriff auf KI-Systeme, der es ermöglicht, die Filter unter Verwendung von ASCII-Bildern zu umgehen.

Zusatz: Yandex GPT2 antwortet ebenfalls hervorragend auf Fragen mit ASCII-Grafik. Beispiel mit dem Wort „HELLO“:

ArtPrompt - ein Angriff auf KI-Systeme, der es ermöglicht, die Filter unter Verwendung von ASCII-Bildern zu umgehen.


Quelle: opennet.ru
60GB SSD 8Gb DDR4