한 줄 요약
LLM을 사용한 제로샷 평가 시스템이 단어 수준의 공격으로 과도한 점수를 부여받는 취약성을 드러냄.
핵심 기여도
- **유니버설 적대적 공격**을 통해 LLM 평가 시스템을 조작할 수 있음을 실증 (예: 5토큰 공격 문장).
- **Surrogate Attack** 알고리즘을 제안: FlanT5-3B를 대상으로 공격 문장을 학습한 후, Llama2-7B, Mistral-7B, ChatGPT 등 다른 모델로 전이.
- 절대 평가(scoring)는 비교 평가(comparative)보다 공격에 **더 취약**함을 밝힘.
- **Perplexity**를 사용한 간단한 탐지 방법을 제시.
핵심 아이디어
LLM-as-a-judge 시스템은 제로샷으로 텍스트를 평가하지만, 이는 적대적 공격에 취약할 수 있음을 제기한다. 연구팀은 **단일 공격 문장**(universal adversarial phrase)을 텍스트 끝에 붙이면 LLM이 **최고 점수를 무조건 부여**하도록 유도할 수 있음을 보여준다. 이는 **FlanT5-3B**를 대상으로 공격 문장을 학습한 후, **Llama2-7B, Mistral-7B, ChatGPT** 등 다른 모델로 전이하는 **Surrogate Attack** 방식을 통해 실현된다. 핵심 통찰은, **적대자가 모델 구조나 파라미터를 모르더라도** 간단한 공격 문장으로 평가 시스템을 조작할 수 있다는 점이다. 특히 절대 평가 방식은 비교 평가보다 공격에 더 취약하다는 점이 주목된다.
기술적 접근법
- **데이터셋**: SummEval, TopicalChat 사용. 개발/테스트 세트는 20:80 비율로 분할.
- **공격 학습**: 개발 세트(20%)를 사용해 **Greedy Search**로 공격 문장을 학습.
- **공격 대상**: FlanT5-xl을 Surrogate Model로 사용.
- **공격 전이**: 학습된 공격 문장을 Mistral-7B, Llama2-7B, GPT3.5로 전이.
- **공격 문장**: 5토큰 이내의 영어 단어로 구성 (NLTK 단어 목록 사용).
- **평가 방식**: 절대 평가(scoring)와 비교 평가(comparative)를 별도로 실험.
주요 결과
- **SummEval** 데이터셋에서 절대 평가 시, 공격 적용 시 **최대 점수 예측**.
- **FlanT5-3B**에서 학습한 공격 문장이 **ChatGPT**에도 전이되어 동일하게 최고 점수를 유도.
- 비교 평가(comparative)는 절대 평가(scoring)보다 **공격에 더 강건**함.
- **Perplexity** 기반 탐지 방법은 일부 성공적으로 공격을 감지.
의의 및 한계
이 연구는 LLM-as-a-judge 시스템의 **보안 취약성**을 처음으로 실증적으로 밝혀낸 것으로, 고위험 상황에서의 사용 시 **신뢰도 문제가 발생**할 수 있음을 경고한다. 특히, 절대 평가 방식은 공격에 취약하며, 이는 교육 평가, 모델 벤치마킹 등에서 **실질적 위험**을 야기할 수 있다. 한편, 공격 탐지 방법은 아직 초기 단계이며, **더 정교한 방어 전략**이 필요하다는 한계도 지적된다.
실용적 활용
이 연구는 **교육 평가 시스템**, **AI 모델 벤치마킹**, **채점 자동화 도구** 등에서 LLM을 사용할 때 **보안 강화**가 필수적임을 시사한다. 특히, **점수 조작 방지를 위한 탐지 알고리즘** 개발 및 **공격에 강건한 평가 방식**(예: 비교 평가) 채택이 필요하다.