Eine Gruppe von Forschern der UniversitĂ€ten Washington, Illinois und Chicago hat eine neue Methode entdeckt, um die EinschrĂ€nkungen bei der Verarbeitung von gefĂ€hrlichem Inhalt in KI-Chatbots, die auf groĂen Sprachmodellen (LLM) basieren, zu umgehen. Der Angriff basiert darauf, dass die Sprachmodelle GPT-3.5, GPT-4 (OpenAI), Gemini (Google), Claude (Anthropic) und Llama2 (Meta) erfolgreich Text erkennen und in den Anfragen berĂŒcksichtigen, der als ASCII-Grafik formatiert ist. Somit war es ausreichend, verbotene Wörter in Form von ASCII-Bildern anzugeben, um die Filter gefĂ€hrlicher Fragen zu umgehen.


In Bezug auf die Effizienz ĂŒbertrifft die neue Angriffsmethode deutlich andere bekannte Möglichkeiten, die Filter in Chatbots zu umgehen. Die höchste QualitĂ€t der Erkennung von ASCII-Grafiken wurde bei den Modellen Gemini, GPT-4 und GPT-3.5 festgestellt, wobei die Erfolgsrate beim Umgehen der Filter (HPR, Helpful Rate, erfolgreicher Anfragebearbeitungskoeffizient) in den Tests bei 100%, 98% und 92% lag, die Angriffserfolgsrate (ASR, Attack Success Rate) bei 76%, 32% und 76% und die GefĂ€hrlichkeit der erhaltenen Antworten (HS, Harmfulness Score) auf einer Skala von fĂŒnf Punkten bei 4.42, 3.38 und 4.56 Punkten, entsprechend.


Die Forscher haben auch gezeigt, dass die derzeit verbreiteten Schutzmethoden gegen das Umgehen von Filtern (PPL, Paraphrase und Retokenization) ineffektiv sind, um den ArtPrompt-Angriff zu blockieren. DarĂŒber hinaus erhöhte die Verwendung der Methode Retokenization sogar die Anzahl der erfolgreich verarbeiteten Anfragen.

Zusatz: Yandex GPT2 antwortet ebenfalls hervorragend auf Fragen mit ASCII-Grafik. Beispiel mit dem Wort âHELLOâ:

Quelle: opennet.ru
