한 줄 요약
Prometheus 2는 직접 평가와 순위 평가 모두에서 GPT-4 수준의 성능을 보이는 오픈소스 평가 언어 모델이다.
핵심 기여도
- Prometheus 2(7B & 8x7B)는 직접 평가 및 순위 평가 모두에서 기존 오픈소스 평가 모델 대비 0.2 이상의 높은 피어슨 상관 계수를 기록.
- Preference Collection이라는 새로운 1,000개 이상의 사용자 정의 평가 기준을 포함한 순위 평가 데이터셋을 제안.
- 직접 평가 및 순위 평가 모델의 가중치를 병합하는 방식으로 단일 통합 평가 모델을 구축, 기존 방식 대비 성능 향상.
핵심 아이디어
기존 오픈소스 평가 모델은 직접 평가와 순위 평가 중 하나만 수행하거나, 인간 평가와 GPT-4와의 일관성 부족 등의 문제를 보였다. Prometheus 2는 이 두 평가 방식을 모두 처리할 수 있도록 설계되었으며, 사용자 정의 평가 기준을 지원한다. 핵심 아이디어는 Feedback Collection(직접 평가)과 Preference Collection(순위 평가) 데이터셋에 기반한 두 개의 평가 모델을 학습한 후, 그 가중치를 병합하여 통합 모델을 생성하는 것이다. 이는 기존의 단일 형식 학습 모델보다 더 높은 유연성과 정확도를 제공한다.
기술적 접근법
- **모델 아키텍처**: Mistral-7B 및 Mixtral-8x7B를 기반으로 학습.
- **데이터셋**: Feedback Collection(직접 평가)와 Preference Collection(순위 평가)를 사용.
- **학습 방법**: 두 데이터셋에 맞게 각각 학습된 평가 모델의 가중치를 병합하여 통합 모델 Prometheus 2를 생성.
- **평가 형식**: 직접 평가 및 순위 평가 모두 처리 가능.
- **하이퍼파라미터**: 구체적 학습률, 배치 크기 등은 명시되지 않음.
주요 결과
- **직접 평가 벤치마크 (Vicuna Bench, MT Bench, FLASK, Feedback Bench)**: Prometheus 2는 기존 오픈소스 평가 모델 대비 피어슨 상관 계수가 0.2 이상 높음.
- **순위 평가 벤치마크 (HHH Alignment, MT Bench Human Judgment, Auto-J Eval, Preference Bench)**: Prometheus 2는 인간 평가자와의 일치율이 가장 높으며, GPT-4와의 성능 격차를 반으로 줄임.
- **사용자 정의 기준 평가**: Preference Collection 데이터셋을 통해 1,000개 이상의 평가 기준을 지원.
의의 및 한계
Prometheus 2는 오픈소스 평가 모델로서 인간 및 GPT-4 평가와의 일관성을 높이며, 평가의 투명성과 제어 가능성을 향상시킨다. 특히, 사용자 정의 평가 기준을 지원함으로써 실제 산업 및 연구 환경에서의 유연한 적용이 가능하다. 그러나 모델의 학습 데이터셋이 특정 벤치마크에 의존적이라는 한계가 있으며, 더 다양한 도메인에서의 평가가 필요하다. 또한, 가중치 병합 방식의 내부 메커니즘에 대한 이론적 해석은 부족한 상태이다.
실용적 활용
Prometheus 2는 언어 모델의 질적 평가가 필요한 연구 및 산업 분야에서 활용 가능하다. 특히, 대규모 평가 과정에서 투명성과 비용 효율성을 요구하는 경우에 적합하며, 사용자 정의 기준을 기반으로 한 맞춤형 평가 시스템 구축에도 활용할 수 있다.