한 줄 요약
자체적으로 보상을 생성하는 Self-Rewarding Language Models를 제안하여 LLM의 지속적 성능 향상을 실현한다.
핵심 기여도
- Llama 2 70B 모델을 3회 반복된 Iterative DPO 훈련을 통해 AlpacaEval 2.0에서 Claude 2, Gemini Pro, GPT-4 0613을 초과하는 성능을 달성.
- 기존 RLHF와 DPO 방식에서 고정된 reward model의 한계를 극복하고, 모델이 자체적으로 보상을 생성하는 Self-Rewarding 방식을 제안.
- Iterative DPO 훈련 과정에서 instruction following 능력과 reward modeling 능력이 동시에 향상됨을 실증.
핵심 아이디어
기존 reward model은 인간의 선호 데이터로 학습되어 고정되며, 이는 LLM 훈련의 성능 한계를 초래한다. 본 연구는 LLM이 자체적으로 보상을 생성하고 훈련 데이터를 생성하는 Self-Rewarding Language Models를 제안한다. 이는 LLM-as-a-Judge 프롬프팅을 통해 모델 스스로 생성한 응답에 대한 reward를 부여하고, 이를 기반으로 Iterative DPO를 수행하는 방식이다. 이 과정에서 reward modeling 능력이 훈련 과정에서 동적으로 향상되며, 이는 기존 고정 reward model과는 구별된다. 핵심 아이디어는 reward model과 LLM을 분리하지 않고, 하나의 시스템 내에서 학습을 진행함으로써 task transfer와 지속적 개선을 가능하게 하는 것이다.
기술적 접근법
- **Self-Instruction Creation**: 모델이 새로운 프롬프트에 대해 응답을 생성하고, LLM-as-a-Judge 프롬프팅을 통해 자체적으로 reward를 부여.
- **Iterative DPO**: DPO 알고리즘을 반복적으로 적용하며, 각 반복에서 이전 모델(M₁, M₂)을 기반으로 새로운 훈련 데이터(AIFT)를 생성.
- **Seed 모델**: Llama 2 70B를 Open Assistant 데이터로 미세조정한 M₀ 모델로 시작.
- **훈련 단계**: M₁ → M₂ → M₃ 순으로 Iterative DPO를 수행하며, reward modeling 능력이 훈련 과정에서 향상됨.
주요 결과
- **AlpacaEval 2.0**: 3회 반복된 Iterative DPO 훈련을 거친 Self-Rewarding LLM은 Claude 2, Gemini Pro, GPT-4 0613을 포함한 기존 시스템을 상회.
- **Instruction Following 성능**: 기존 seed 모델 대비 훈련 과정에서 지속적으로 향상됨.
- **Reward Modeling 능력**: 고정 reward model과 달리, Iterative DPO 과정에서 reward modeling 능력이 향상됨. 예를 들어, 이전 반복 대비 더 높은 품질의 preference dataset을 생성할 수 있음.
의의 및 한계
본 연구는 reward model과 LLM을 분리하지 않고, 하나의 시스템 내에서 reward modeling과 instruction following을 동시에 학습하는 새로운 접근법을 제시한다. 이는 기존 RLHF와 DPO 방식의 인간 선호 데이터에 의존하는 한계를 극복하고, LLM의 지속적 성능 향상을 가능하게 한다는 점에서 학술적·실용적 의의가 있다. 그러나 반복 훈련 과정에서 성능 향상이 포화될 수 있으며, 초기 seed 데이터의 질에 따라 최종 성능이 영향을 받을 수 있다는 한계가 있다.
실용적 활용
Self-Rewarding Language Models는 인간의 직접적인 피드백 없이도 LLM이 스스로 개선할 수 있는 시스템을 구축하는 데 활용될 수 있다. 이는 대규모 훈련 데이터가 부족하거나, 인간 피드백이 제한적인 상황에서 특히 유용하며, 챗봇, 자동화된 고객 지원, 지능형 어시스턴트 등 다양한 산업 분야에 적용 가능하다.