한 줄 요약
RPO는 적대적 프롬프트 공격에 대응하기 위해 최적화 기반 방어 알고리즘으로, GPT-4와 Llama-2에서 ASR을 각각 6%와 0%까지 감소시킨다.
핵심 기여도
- 최초로 적대적 공격을 고려한 **minimax 최적화 목표**를 정식화하여, 다양한 공격과 적응적 적대자에 대한 방어를 가능하게 함.
- **RPO(Robust Prompt Optimization)** 알고리즘을 제안하여, **경량화되고 전이 가능한 suffix**를 최적화하여 방어 성능을 향상.
- **JailbreakBench**에서 GPT-4의 ASR을 6%, Llama-2의 ASR을 0%로 감소시켜 **최신 기술 수준**(SOTA)을 달성.
- **적응적 공격**(adaptive attacks)에도 강건한 방어를 보장하며, **추론 비용**은 거의 발생하지 않음.
핵심 아이디어
기존 방어 방법은 특정 공격에만 효과적이거나, 새로운 공격에 대응하지 못하는 한계가 있었다. 본 연구는 **적대자를 방어 목표에 직접 통합**하는 새로운 접근법을 제안한다. 이는 **minimax 최적화 문제**로 모델링되며, 방어 대상이 되는 LLM에 **경량화된 suffix**를 추가하여 입력을 조정함으로써 공격에 대한 강건성을 높인다. RPO는 **공격 선택**과 **이산 최적화**를 결합하여, 다양한 공격 시나리오에 유연하게 대응할 수 있도록 설계되었다.
기술적 접근법
- **RPO 알고리즘**: 적대적 공격을 고려한 방어 목표를 최적화하는 이산 최적화 알고리즘.
- **minimax 최적화 목표**: 방어 대상 LLM의 출력을 최소화하고, 적대자의 공격 효과를 최대화하는 목표를 동시에 고려.
- **suffix 최적화**: 입력에 추가되는 **경량화된 suffix**를 최적화하여, 공격에 대한 방어력을 높임.
- **적응적 공격**(adaptive attacks)에 대응하기 위해, 공격 선택 과정에서 다양한 공격 기법을 고려.
- **JailbreakBench**와 **HarmBench** 데이터셋을 사용하여 평가.
주요 결과
- **JailbreakBench**에서 RPO는 GPT-4의 ASR을 6%로, Llama-2의 ASR을 0%로 감소시킴.
- 기존 방어 방법 대비 **공격 성공률**(ASR)이 **최대 94% 감소**.
- **적응적 공격**에도 강건하며, **추론 비용**은 거의 발생하지 않음.
- **benign prompt**(일반 입력)에 미치는 영향은 **미미**함.
의의 및 한계
RPO는 **시스템 레벨 방어**(system-level guardrails)를 통해 LLM의 안전성을 향상시키는 실용적 접근법을 제시한다. 특히, **적응적 공격**에 대한 강건성과 **경량화된 방어 구조**는 기존 방어 방법과 차별화된다. 그러나 RPO는 특정 **suffix 기반 방어**이므로, 공격자가 이 suffix를 우회하는 새로운 공격 기법이 등장할 경우 한계가 있을 수 있다. 또한, **모델 내부 구조에 대한 접근이 필요하지 않기 때문에**, 일부 시스템에서의 적용 가능성은 제한적일 수 있다.
실용적 활용
RPO는 **LLM 기반 서비스**(예: 챗봇, 콘텐츠 생성 플랫폼)에서 **실시간 방어**를 제공할 수 있으며, 특히 **블랙박스 모델**(예: GPT-4)에도 적용 가능하다. **시스템 레벨 방어**로 설계되어, 사용자에게 노출되지 않으면서도 안전성을 유지할 수 있어, **보안 강화** 및 **정책 준수**를 위한 실용적 도구로 활용 가능하다.