한 줄 요약
ASCII 아트를 활용한 새로운 제이크브레이크 공격 ArtPrompt가 기존 안전 정렬 기법의 취약점을 드러낸다.
핵심 기여도
- Vision-in-Text Challenge (ViTC) 벤치마크를 제안하여 ASCII 아트로 표현된 프롬프트 인식 능력을 평가.
- GPT-3.5, GPT-4, Gemini, Claude, Llama2 등 5개 최신 LLM이 ASCII 아트 인식에 실패함을 실증.
- ArtPrompt 공격이 Black-box 접근으로도 5개 LLM 모두에서 효과적으로 작동함을 실험적으로 입증.
- ArtPrompt는 기존 방어 기법(Perplexity, Paraphrase, Retokenization)을 모두 우회함을 보여.
핵심 아이디어
기존 LLM 안전 정렬 기법은 텍스트가 의미론적 해석만으로 처리된다고 가정하지만, 실제 사용 환경에서는 ASCII 아트처럼 시각적 구조를 통해 정보가 전달되는 경우가 많다. 이는 LLM이 의미론적 해석만으로는 ASCII 아트를 올바르게 해석하지 못함을 악용한 새로운 제이크브레이크 공격이 가능하게 한다.
ArtPrompt는 두 단계로 구성된다: 첫째, 사용자의 악의적 프롬프트에서 거부 반응을 유발할 수 있는 단어를 식별하고, 둘째, 해당 단어를 ASCII 아트로 시각화하여 LLM에 전달함으로써 안전 메커니즘을 우회한다. 이는 LLM이 ASCII 아트를 의미론적으로 해석하지 못함을 악용한 공격 방식이다.
기술적 접근법
- **ArtPrompt 공격 단계**: Step I (단어 식별), Step II (ASCII 아트로 변환 및 전달).
- **사용된 데이터셋**: AdvBench, HEx-PHI.
- **평가 대상 모델**: GPT-3.5, GPT-4, Gemini, Claude, Llama2.
- **방어 기법 대비 실험**: Perplexity, Paraphrase, Retokenization.
- **ASCII 아트 폰트 분석**: Appendix A.3의 tail-set 폰트를 사용한 실험.
- **정렬 방식 실험**: 수직 정렬이 ArtPrompt 효과를 저하시킴을 확인.
주요 결과
- ViTC 벤치마크에서 5개 LLM 모두 ASCII 아트로 표현된 단일 글자나 숫자를 인식하지 못함.
- ASCII 아트가 포함된 입력이 복잡해질수록 LLM의 인식률은 0%에 가까워짐.
- ArtPrompt는 5개 LLM 모두에서 100%의 성공률을 기록하며, 기존 제이크브레이크 공격(GCG, AutoDan 등)보다 평균적으로 우수함.
- ArtPrompt는 Perplexity, Paraphrase, Retokenization 방어 기법을 모두 우회함.
의의 및 한계
ArtPrompt는 LLM 안전 정렬 기법의 핵심 가정인 '의미론적 해석만으로 텍스트를 처리한다'는 가정을 무효화함으로써, 기존 방어 기법을 우회하는 새로운 공격 벡터를 제시한다. 이는 LLM의 안전성 평가 기준을 확장하고, 시각적 구조를 포함한 다중 해석 방식을 고려한 새로운 정렬 기법 개발을 촉구한다.
한계로는 ArtPrompt가 특정 ASCII 아트 폰트나 정렬 방식에 따라 효과가 달라질 수 있으며, 수직 정렬은 성능 저하를 초래한다는 점이 있다. 또한, ArtPrompt는 Black-box 공격이므로 모델 내부 구조를 모르는 공격자도 사용할 수 있다는 점에서 실용적 위협이 크다.
실용적 활용
ArtPrompt는 포럼, 채팅, SNS 등에서 사용자들이 텍스트 기반 이미지(ASCII 아트)로 악의적 요청을 숨기는 경우에 적용될 수 있다. 이는 LLM 기반 챗봇, 콘텐츠 필터링 시스템, 보안 감시 플랫폼 등에서 시각적 구조를 포함한 텍스트 해석 능력을 강화해야 하는 중요한 시사점을 제공한다.