한 줄 요약
SALAD-Bench는 LLM의 안전성, 공격, 방어를 종합적으로 평가하기 위한 계층적 벤치마크로, MD-Judge와 MCQ-Judge 평가자와 함께 제공된다.
핵심 기여도
- SALAD-Bench는 3단계 계층 구조(6 도메인, 16 태스크, 66 범주)를 갖춘 종합적 안전성 벤치마크.
- 공격 강화 질문과 다중 선택 질문(MCQ)을 포함해 평가의 난이도와 다양성을 확대.
- LLM 기반 MD-Judge와 MCQ-Judge 평가자를 도입해 안정적이고 효율적인 평가를 가능하게 함.
- 공격 및 방어 방법 평가를 통합하여 LLM 안전성 연구의 범위를 확장.
핵심 아이디어
기존 LLM 안전성 평가 벤치마크는 대부분 특정 유형의 위험(예: 독성 표현, 부적절한 지시)에만 초점을 맞추며, 공격 및 방어 메커니즘을 종합적으로 평가하지 못했다. SALAD-Bench는 이러한 한계를 극복하기 위해 3단계 계층적 분류 체계를 도입하고, 공격 강화 질문과 MCQ를 포함해 평가의 범위와 난이도를 확장했다. 특히, MD-Judge는 공격 강화 질문에 특화된 평가 모델로, 텍스트 쌍(QA)을 분류하며, MCQ-Judge는 정규 표현식을 활용해 MCQ 평가를 효율적으로 수행한다. 이는 기존 키워드 기반 또는 GPT 기반 평가 방식보다 정확도와 속도에서 우수한 성능을 보인다.
기술적 접근법
- **SALAD-Bench 구조**: 3단계 계층 구조(6 도메인, 16 태스크, 66 범주)로 구성.
- **MD-Judge**: Mistral-7B 기반으로 훈련된 평가 모델로, 공격 강화 QA 쌍을 포함한 데이터로 학습. GPT-4로 라벨링한 데이터와 오픈소스 안전 데이터를 사용.
- **MCQ-Judge**: 정규 표현식을 활용한 in-context 학습을 통해 MCQ 평가 수행. `<ans>`와 `<eoa>` 토큰을 사용해 응답을 정확히 추출.
- **공격/방어 평가**: 공격 강화 질문 세트와 방어 강화 질문 세트를 통해 공격 및 방어 방법의 효과성을 평가.
주요 결과
- **MD-Judge 성능**: 인간 평가와 유사한 정확도를 보이며, 평균 0.43초의 저지연 시간.
- **LLM 안전성 평가**: Claude2가 99.77%의 안전률로 가장 높은 성능, GPT-3.5는 88.62%로 가장 낮음. 공격 강화 세트에서는 안전률이 크게 하락.
- **방어 방법 평가**: GPT-파라프레이징과 Self-Reminder 프롬프트가 가장 효과적. Mistral-7B의 ASR은 방어 전 93.60%에서 24.98%로 감소.
- **공격 방법 평가**: 인간 설계된 jailbreak 프롬프트가 가장 높은 공격 성공률(ASR)을 보임.
의의 및 한계
SALAD-Bench는 LLM의 안전성, 공격, 방어를 종합적으로 평가할 수 있는 체계적인 도구로, 기존 벤치마크의 한계를 극복한 점에서 학술적·실용적 가치가 높다. 특히, MD-Judge와 MCQ-Judge는 기존 평가 방식보다 정확도와 효율성을 동시에 담보하며, 다양한 LLM을 평가할 수 있는 확장성을 제공한다. 그러나 일부 모델(예: Gemini)은 공격 강화 세트에서 안전률이 급격히 하락하며, 방어 방법의 효과성도 모델에 따라 크게 달라지는 한계가 있다. 또한, 일부 공격 방법(예: GCG)은 방어에 취약하며, 이는 방어 전략 개선의 필요성을 시사한다.
실용적 활용
SALAD-Bench는 LLM 개발자들이 모델의 안전성, 공격에 대한 저항력, 방어 전략의 효과성을 체계적으로 평가하는 데 활용할 수 있다. 특히, 공공 부문, 보안 연구, AI 윤리 연구 등에서 모델의 신뢰성과 안정성을 검증하는 데 유용하게 사용될 수 있다.