한 줄 요약
LLaDA 1.5는 ELBO 기반의 Variance-Reduced Preference Optimization(VRPO)를 통해 수학, 코드, 정렬 작업에서 기존 모델 대비 1~4.7% 성능 향상.
핵심 기여도
- VRPO 프레임워크를 제안하여 ELBO 추정치의 분산을 이론적으로 분석하고, 편향과 분산의 상계를 유도.
- 최적 Monte Carlo 예산 할당과 antithetic sampling을 통해 MDM 정렬 성능을 4.7% (GSM8K), 3.0% (HumanEval) 개선.
- LLaDA 1.5는 기존 SFT 모델 대비 수학, 코드, 정렬 벤치마크에서 일관된 성능 향상.
- VRPO는 DPO 알고리즘에 적용되며, 8배의 계산 증가에도 불구하고 전체 사전 학습 비용의 0.5% 미만으로 유지.
핵심 아이디어
기존 MDM 정렬 연구는 ELBO 기반의 로그-우도 추정치의 높은 분산 문제를 해결하지 못한 채 DPO를 적용하려는 시도가 부족했다. 본 연구는 ELBO 추정치의 분산이 DPO 손실과 그라디언트의 편향과 분산에 직접적인 영향을 미친다는 이론적 통찰을 제시한다. 이를 바탕으로 VRPO는 ELBO 추정 분산을 줄이는 3가지 무편향 전략을 제안: (1) ELBO 샘플링 예산 증가, (2) 시간 단계별 최적 샘플 할당, (3) 모델 정책과 참조 정책 간 antithetic 샘플링. 이는 DPO 알고리즘의 수렴 안정성과 정확도를 동시에 향상시킨다.
기술적 접근법
- **VRPO**: ELBO 추정치의 분산을 줄이기 위한 3가지 전략을 통합한 정렬 프레임워크.
- **ELBO 추정**: ELBO는 4개의 항으로 구성된 선형 결합 형태이며, 이는 DPO 손실 함수에 직접적으로 반영됨.
- **샘플링 예산**: 기본적으로 $ n = 8 $ (시간 단계 $ n_t $ × 마스킹 샘플 $ n_{y_t} $)로 설정.
- **최적 할당**: $ n_t/n_{y_t} = 4/1 $이 $ 1/4 $ 대비 모든 지표에서 우수한 성능을 보임.
- **Antithetic Sampling**: 샘플링 분산을 2.2 → 1.0 수준으로 감소시키며, 손실 및 그라디언트 분산도 3.1 × 10⁻³ → 2.6 × 10⁻³ 수준으로 감소.
주요 결과
- **수학**: GSM8K에서 +4.7% (82.8), Math에서 +4.0% (42.3), GPQA에서 +4.0% (36.4).
- **코드**: HumanEval에서 +3.0% (51.2), MBPP에서 +1.8% (42.8).
- **정렬**: IFEval에서 +4.0% (66.1), Arena-Hard에서 +4.3% (13.9).
- **샘플링 예산 증가 효과**: $ n = 1 $ → $ n = 8 $로 증가시 GSM8K 정확도 80.1 → 83.3 향상.
- **Antithetic Sampling 제거 시**: $ \mathbb{V}\hat{s}_{\theta} $ 1.0 → 2183.7로 급증, GSM8K 정확도 83.3 → 82.0 감소.
의의 및 한계
LLaDA 1.5는 MDM이 RL 기반 정렬 알고리즘과 호환 가능함을 입증하며, ELBO 기반 추정 분산 제어가 정렬 성능에 결정적임을 실증적으로 보여준다. VRPO는 DPO 외에도 다른 정렬 알고리즘으로 확장 가능하며, MDM 정렬 연구의 이론적·실용적 기반을 제공한다. 그러나 VRPO는 추가 계산 자원이 필요하며, 일부 벤치마크(예: MTBench, Arena-Hard)에서는 개선 폭이 제한적임. 이는 데이터 다양성과 모델 구조에 따라 달라질 수 있는 것으로 추정된다.
실용적 활용
LLaDA 1.5는 수학 문제 해결, 코드 생성, 대화 정렬 등 다양한 NLP 작업에 적용 가능하며, 특히 ELBO 기반 추정 분산이 큰 MDM 정렬 작업에서 VRPO 적용이 효과적이다. 산업적으로는 대규모 언어 모델의 인간 정렬을 요구하는 챗봇, 코드 생성 도구, 교육 AI 등에 활용 가능하다.