한 줄 요약
ComPO는 비교 오라클 기반의 제로차 수식 선호 정렬 방법으로, 소량의 가능성 차이를 가진 선호 쌍을 활용해 모델 정렬 성능을 향상시킨다.
핵심 기여도
- **ComPO** (Comparison-based Preference Optimization)를 제안, 기존 DPO 대비 소량의 가능성 차이를 가진 선호 쌍을 효과적으로 활용.
- **likelihood displacement** 문제를 완화하는 방식으로, **Gemma-2B-it** 모델에서 안전한 응답 확률을 증가시키는 결과를 보임.
- **offline ComPO**는 **smoothness**, **gradient sparsity**, **oracle-latent compatibility** 조건 하에 수렴 보장을 제공.
- **online ComPO**는 **reverse-KL control**을 통해 정책 편차를 제어하며, **local coverage**와 **in-distribution pairwise reward accuracy** 조건 하에 성능 보장을 확보.
핵심 아이디어
기존 DPO는 선호 쌍을 기반으로 확률 차이를 최대화하는 방식으로 정렬을 수행하지만, 이는 **likelihood displacement** 문제를 유발할 수 있다. 즉, 선호 응답의 상대적 확률은 증가하지만, **절대 확률은 감소**할 수 있어 모델이 **위험한 응답을 생성할 가능성**이 높아진다. ComPO는 이 문제를 해결하기 위해 **선호 쌍을 직접적인 손실 최적화 대상이 아닌 비교 신호(comparison signal)**로 사용한다.
ComPO는 정책을 약간 변형(perturbation)하고, 이 변형이 선호 응답의 확률을 증가시키고 비선호 응답의 확률을 감소시키는지 평가하여 **방향 정보(directional information)**를 추출한다. 이 방식은 **zeroth-order optimization**에 기반하며, **미분 가능한 손실 함수를 사용하지 않아** 소량의 가능성 차이를 가진 쌍에도 적용 가능하다.
기술적 접근법
- **ComPO (Comparison-based Preference Optimization)**: 비교 오라클을 기반으로 정책을 조정하는 제로차 수식 최적화 방법.
- **Offline ComPO**: 정책을 약간 변형하고, 각 변형이 선호 응답의 확률을 증가시키는지 평가.
- **Online ComPO**: **unlabeled policy generations**를 사용해 **reverse-KL control**을 수행하며, 정책 편차를 제어.
- **수렴 보장**: **smoothness**, **gradient sparsity**, **oracle-latent compatibility** 조건 하에 수렴 보장.
- **성능 보장**: **local coverage**, **in-distribution pairwise reward accuracy** 조건 하에 성능 보장.
- **하이퍼파라미터**: **perturbation 크기**, **perturbed layer 수**, **noisy pair 비율** 등을 실험적으로 조정.
주요 결과
- **Mistral, Llama, Gemma-2, Qwen3, Gemma-3** 모델에서 기존 DPO 대비 **length-controlled win rates** 향상.
- **Gemma-2B-it** 모델에서 **likelihood displacement** 문제 완화를 보여주는 **pair-level diagnostics** 결과.
- **offline ComPO**는 **noisy preference pairs**를 활용해 정렬 성능을 향상시키며, **DPO 대비 +10% 이상의 개선**을 보임.
- **online ComPO**는 **reverse-KL control**을 통해 정책 편차를 제어하며, **local coverage** 조건 하에 안정적인 성능 보장.
의의 및 한계
ComPO는 **likelihood displacement** 문제를 완화하고, **noisy preference pairs**를 효과적으로 활용할 수 있는 새로운 정렬 접근법을 제시한다. 기존 DPO와 달리 **미분 가능한 손실 함수를 사용하지 않아** 소량의 가능성 차이를 가진 쌍에도 적용 가능하며, **정렬 정확도와 안전성**을 동시에 향상시킨다.
그러나, ComPO는 **perturbation 크기**, **perturbed layer 수**, **noisy pair 비율** 등 하이퍼파라미터에 민감하며, **수렴 보장 조건**이 제한적이다. 또한, **모든 선호 쌍에 적용 가능한 일반화된 정렬 방법**으로 확장하기 위해서는 추가 연구가 필요하다.
실용적 활용
ComPO는 **대형 언어 모델의 안전한 응답 생성**, **정책 최적화**, **RLHF 대체 정렬 방법**으로 활용 가능하다. 특히, **likelihood displacement** 문제를 겪는 모델에서 **정렬 정확도와 안전성**을 동시에 향상시키는 데 유용하며, **정책 편차 제어**가 필요한 상황에서 **reverse-KL control** 기법을 활용할 수 있다.