한 줄 요약
ProSA는 LLM의 프롬프트 민감도를 평가하고 이해하기 위한 프레임워크로, 새로운 지표 PromptSensiScore(PSS)를 제안하고 해석력을 제공한다.
핵심 기여도
- ProSA 프레임워크를 제안하여 인스턴스 수준에서 LLM의 프롬프트 민감도를 평가.
- 새로운 민감도 지표 PromptSensiScore(PSS)를 정의: 동일 인스턴스에 대해 다른 프롬프트가 주어졌을 때 응답의 평균 차이를 측정.
- 해독 신뢰도(Decoding Confidence)를 활용해 민감도의 근본 원인을 분석.
- Llama3-70B-Instruct가 12개 프롬프트 변형에서 가장 높은 robustness를 보임.
핵심 아이디어
기존 연구는 주로 데이터셋 수준에서 평가를 수행하며, 실제 사용자 경험에 가까운 인스턴스 수준의 민감도 분석을 간과했다. ProSA는 이 문제를 해결하기 위해 인스턴스 수준의 분석을 강조하고, PSS라는 새로운 지표를 도입하여 LLM이 동일한 작업에 대해 다른 프롬프트로 인해 얼마나 다른 결과를 내는지를 측정한다. 이는 객관적 평가(정확도 기반)와 주관적 평가(질적 평가 기반) 모두에서 적용 가능하다. 또한, 해독 신뢰도를 통해 LLM의 민감도가 내재적 신뢰도와 연관되어 있음을 밝혀내어, 민감도가 단순한 입력 변화에 대한 반응이 아니라 모델의 내부 메커니즘을 반영한다는 통찰을 제공한다.
기술적 접근법
- **PromptSensiScore (PSS)**: 동일 인스턴스에 대해 다른 프롬프트로 인한 응답 차이의 평균을 계산.
- 수식: $ \text{PSS} = \frac{1}{N} \sum_{i=1}^{N} \frac{1}{C(|P|,2)} \sum_{i<j} |Y(P_i) - Y(P_j)| $
- **인스턴스 수준 평가**: 8개 LLM, 4개 데이터셋, 12개 프롬프트 변형으로 평가.
- **해독 신뢰도 분석**: 정답에 대한 신뢰도를 측정하여 민감도와의 상관관계 분석.
- **Few-shot 효과 분석**: 0-shot에서 1-shot으로 전환 시 민감도 감소, 특히 대형 모델에서 효과 두드러짐.
주요 결과
- **Llama3-70B-Instruct**는 12개 프롬프트 변형에서 가장 높은 robustness를 보임.
- **PSS < 0.1**이면 LLM이 높은 프롬프트 robustness를 가짐.
- **Few-shot 예시**는 민감도 감소에 기여, 특히 0-shot에서 1-shot으로 전환 시 효과 큼.
- **LC AlpacaEval 2.0 및 Arena Hard Auto**에서 주관적 평가에서도 민감도가 나타남.
- **복잡한 추론 작업**에서 민감도가 높고, **기존 지식 기반 작업**(예: IT 문제 해결)에서는 더 안정적임.
의의 및 한계
ProSA는 LLM의 민감도를 인스턴스 수준에서 정량적으로 평가할 수 있는 체계적인 프레임워크를 제공하며, 민감도가 모델의 내재적 신뢰도와 연관되어 있음을 밝혀내어 이론적 기반을 강화한다. 또한, 주관적 평가에서의 민감도를 분석함으로써 실제 사용자 경험에 더 가까운 평가를 가능하게 한다. 그러나 PSS는 특정 평가 기준에 의존하며, 다양한 작업에서의 적용 가능성은 추가 연구가 필요하다. 또한, 해독 신뢰도와 민감도 간의 인과 관계는 아직 명확히 규명되지 않았다.
실용적 활용
ProSA는 LLM 개발자들이 모델의 안정성과 신뢰도를 평가하는 데 활용할 수 있으며, 특히 사용자 맞춤형 프롬프트 설계나 대화형 시스템 개선에 유용하다. 또한, 주관적 평가에서의 민감도 분석은 사용자 경험 개선 및 모델 튜닝에 실질적인 도움을 줄 수 있다.