한 줄 요약
OR-Bench는 대규모 과거절(over-refusal) 프롬프트를 생성하고 32개 LLM의 거부율을 평가한 첫 번째 벤치마크이다.
핵심 기여도
- OR-Bench-80K: 10개 범주에 걸친 80,000개의 과거절 프롬프트 생성.
- OR-Bench-Hard-1K: 1,000개의 고난도 과거절 프롬프트 포함.
- 32개 LLM(8개 모델 가족)의 과거절 거부율 평가.
- GPT-3.5-turbo-0125는 62%의 유해 프롬프트 거부율, 57%의 과거절 거부율 기록.
핵심 아이디어
과거절은 안전 정렬 강화 과정에서 발생하는 부작용으로, 무해한 요청도 거부하는 현상이다. 기존 연구는 수작업으로 제한된 수의 프롬프트를 사용했지만, 이 연구는 유해 프롬프트를 재작성하여 무해하게 만들고, LLM 모더레이터를 활용해 과거절 프롬프트를 대규모로 생성하는 자동화 프레임워크를 제안했다. 이 방법은 기존 XSTest(250개 수작업)에 비해 확장성과 효율성이 뛰어나다.
또한, 안전성과 도움성 간의 트레이드오프를 분석하기 위해 32개 LLM을 평가한 결과, Claude 모델은 가장 안전하지만 과거절률도 가장 높고, Mistral 모델은 가장 적은 과거절을 보였다. GPT-3.5-turbo-0125는 과거절률 57%로 감소했으나, 유해 프롬프트 거부율은 62%로 낮아져 안전성 저하가 관찰되었다.
기술적 접근법
- **프롬프트 생성 기법**: 유해 프롬프트를 재작성하여 무해하게 변환한 후, LLM 모더레이터로 검증.
- **데이터셋 구성**: OR-Bench-80K(10개 범주, 80,000개), OR-Bench-Hard-1K(1,000개), OR-Bench-Toxic(600개).
- **평가 모델**: Claude, Gemini, GPT, Llama, Mistral, Qwen 등 32개 LLM.
- **평가 방법**: 키워드 매칭과 GPT-4를 사용한 검증. 키워드 매칭은 대부분의 모델에서 GPT-4 평가와 2.4% 이내의 차이를 보임.
- **추가 실험**: 시스템 프롬프트, 온도 조절, 제한 해제 방어 기법의 영향 분석.
주요 결과
- **GPT-3.5-turbo-0125**: OR-Bench-Hard-1K에서 57%의 과거절 거부율, 유해 프롬프트 거부율은 62%.
- **Claude-3-opus**: 과거절 거부율은 낮지만, 유해 프롬프트 거부율은 90% 이상.
- **Mistral-large-latest**: 과거절 거부율은 10% 미만, 유해 프롬프트 거부율은 50% 이상.
- **GPT-4o-08-06**: 과거절 거부율 15%, 유해 프롬프트 거부율 85%로 안전성과 도움성 균형이 우수.
- **Spearman 상관계수**: 안전성(유해 거부율)과 과거절 간 상관계수 0.89로 강한 트레이드오프 관계.
의의 및 한계
OR-Bench는 과거절 문제를 체계적으로 평가할 수 있는 첫 번째 대규모 벤치마크로, 안전 정렬 알고리즘 개선에 기여할 수 있다. 특히, GPT-3.5-turbo 시리즈의 과거절 감소는 안전 정렬 기법의 진화를 보여주며, Claude와 Mistral의 대조적 성능은 모델별 정렬 전략 차이를 드러낸다.
한편, 일부 모델의 평가 결과는 판단자 모델(GPT-4)에 따라 편향될 수 있으며, OR-Bench-Hard-1K는 특수한 생성 방식으로 인해 일반적인 사용 시스템과 차이가 있을 수 있다. 또한, 온도 조절 실험은 자세히 보도되지 않았다.
실용적 활용
OR-Bench는 LLM 개발자들이 안전성과 도움성 간 균형을 조정하는 데 활용할 수 있다. 예를 들어, Claude 모델은 과도한 안전성으로 인해 도움성이 저하된 반면, Mistral은 도움성은 높지만 안전성이 부족하다. 이는 챗봇, 고객 지원, 콘텐츠 생성 등 다양한 산업 분야에서 모델 선택에 중요한 참고 자료가 될 수 있다.