한 줄 요약
Rainbow Teaming은 LLM의 안전성을 진단하고 향상시키기 위해 품질-다양성 검색을 기반으로 한 적대적 프롬프트를 자동 생성하는 새로운 블랙박스 접근법이다.
핵심 기여도
- Rainbow Teaming은 품질-다양성(QD) 검색을 활용하여 Llama 2, Llama 3 등 다양한 LLM에 대해 90% 이상의 공격 성공률을 달성.
- 생성된 적대적 프롬프트는 높은 전이성을 보이며, 합성 데이터로 모델을 미세조정하면 안전성 향상에 기여함.
- 기존 레드팀링 접근법 대비 더 높은 다양성과 성공률을 동시에 달성.
- 질문 응답, 사이버보안 등 다양한 도메인에서 적용 가능성을 보임.
핵심 아이디어
Rainbow Teaming은 기존 적대적 프롬프트 생성 방법이 특정 도메인에 제한적이고, 인간 주도적 또는 다양성 부족한 문제를 해결하기 위해 품질-다양성(QD) 검색을 도입한 새로운 접근법이다. 이는 적대적 프롬프트 생성을 QD 문제로 재구성하여, 공격의 효과성과 다양성을 동시에 최적화한다. 핵심 아이디어는 MAP-Elites 알고리즘을 기반으로, 프롬프트를 "공격 스타일", "위험 범주", "길이" 등의 특성에 따라 분류된 격자 공간에 저장하며, 높은 품질의 프롬프트를 반복적으로 업데이트하는 방식이다. 이는 기존 레드팀링에서 흔히 발생하는 다양성-성공률 간의 트레이드오프를 완화하며, 보다 포괄적인 취약점을 탐지할 수 있도록 한다.
기술적 접근법
- **모델**: Llama 2-chat 7B, Llama 3-Instruct 8B, Mistral 7B, Vicuna 7B v1.5 등을 대상으로 실험.
- **알고리즘**: MAP-Elites 기반의 QD 검색.
- **특성 함수**: 공격 스타일, 위험 범주, 프롬프트 길이 등.
- **변이 연산자**: LLM을 활용한 프롬프트 변이.
- **선호도 모델**: GPT-4 기반의 평가 모델.
- **전이 평가**: Vicuna 7B 1.5 → Mistral 7B로 66% ASR 달성.
- **유사도 필터**: 부모-자식 프롬프트 간 유사도를 제한하여 다양성 유지.
주요 결과
- **Llama 2-chat 7B**: 2000회 반복 후 100개의 프롬프트로 92% ASR 달성.
- **Mistral 7B, Vicuna 7B**: 98% ASR 기록.
- **JailbreakBench**: 1000개의 프롬프트로 100개의 유해 행동을 탐지, 기존 PAIR 대비 더 높은 다양성 유지.
- **전이성**: 평균적으로 원 모델 대비 50%의 ASR 유지.
- **GPT-4o**: 66% ASR 기록, 오픈/클로즈 소스 모델 간 차이 미미.
의의 및 한계
Rainbow Teaming은 LLM의 안전성 진단 및 향상에 있어 기존 레드팀링과 비교해 더 높은 효과성과 다양성을 제공하며, 합성 데이터를 활용한 미세조정을 통해 안전성 향상에 기여한다. 또한, 질문 응답, 사이버보안 등 다양한 도메인에서 적용 가능성을 보여주며, LLM의 안정성 향상에 기여할 잠재력을 가진다. 그러나, 생성된 프롬프트가 특정 모델에 과도하게 의존할 수 있으며, 유사도 필터링이 필요하다는 점에서 한계가 있다. 또한, 계산 비용이 높아 대규모 실험에는 제약이 있을 수 있다.
실용적 활용
Rainbow Teaming은 LLM의 안전성 테스트 및 향상에 활용될 수 있으며, 특히 사이버보안, 질문 응답, 콘텐츠 필터링 등 다양한 분야에서 적대적 입력을 탐지하고 모델의 안정성을 강화하는 데 유용하다. 또한, 합성 데이터 생성을 통한 모델 재교육에도 활용 가능하다.