NjĂ« grup hulumtuesish nga Universiteti i Washingtonit, Universiteti i Illinoisit dhe Universiteti i Ăikagos ka zbuluar njĂ« metodĂ« tĂ« re pĂ«r tĂ« anashkaluar kufizimet nĂ« pĂ«rpunimin e pĂ«rmbajtjeve tĂ« rrezikshme nĂ« AI chatbotĂ«, tĂ« ndĂ«rtuar mbi modelet e mĂ«dha gjuhĂ«sore (LLM). Sulmi bazohet nĂ« fakti se modelet gjuhĂ«sore GPT-3.5, GPT-4 (OpenAI), Gemini (Google), Claude (Anthropic) dhe Llama2 (Meta) njihen dhe marrin nĂ« konsideratĂ« nĂ« kĂ«rkesat e tyre tekstin e paraqitur si grafikĂ« ASCII. KĂ«shtu, pĂ«r tĂ« anashkaluar filtrat e pyetjeve tĂ« rrezikshme, mjaftonte tĂ« tregohet fjalĂ« e ndaluar nĂ« formĂ«n e njĂ« imazhi ASCII.


Sa i përket efektivitetit, metoda e re e sulmit ka tejkaluar ndjeshëm metodat e njohura për anashkalimin e filtrave në chatbotë. Cilësia më e lartë e njohjes së grafikës ASCII është vënë re në modelet Gemini, GPT-4 dhe GPT-3.5, me nivelin e anashkalimit të suksesshëm të filtrave nga kërkesat testuese (HPR, Koeficienti i Pëlqyeshmërisë, koeficienti i suksesit të përpunimit të kërkesave) e cila është vlerësuar në 100%, 98% dhe 92%, niveli i suksesit të realizimit të sulmit (ASR, Koeficienti i Suksesit të Sulmit) në 76%, 32% dhe 76%, dhe niveli i rrezikshmërisë së përgjigjeve të marra (HS, Skor Rrezikshmëri) në një shkallë prej pesë pikësh në 4.42, 3.38 dhe 4.56 pikë, përkatësisht.


Hulumtuesit gjithashtu demonstruan se metodat aktualisht të njohura të mbrojtjes nga anashkalimi i filtrave (PPL, Parafrazim dhe Retokenizim) janë joefektive për bllokimin e sulmit ArtPrompt. Më shumë, përdorimi i metodës Retokenizim madje rriti numrin e kërkesave të përpunuara me sukses.

Shtesë: Yandex GPT2 gjithashtu përgjigjet mjaft mirë në pyetje me grafikë ASCII. Një shembull me fjalën "HELLO":

Burimi: opennet.ru
