Iterative Reasoning Preference Optimization

Richard Yuanzhe Pang, Weizhe Yuan, Kyunghyun Cho, He He, Sainbayar Sukhbaatar, J. Weston

arXiv:2404.19733 · 2026-07-27 공개 · arXiv · PDF

chain-of-thought instruction-tuning gsm8k preference-optimization llama-2 majority-voting iterative-reasoning math

Abstract

Iterative preference optimization methods have recently been shown to perform well for general instruction tuning tasks, but typically make little improvement on reasoning tasks (Yuan et al., 2024, Chen et al., 2024). In this work we develop an iterative approach that optimizes the preference between competing generated Chain-of-Thought (CoT) candidates by optimizing for winning vs. losing reasoning steps that lead to the correct answer. We train using a modified DPO loss (Rafailov et al., 2023) with an additional negative log-likelihood term, which we find to be crucial. We show reasoning improves across repeated iterations of this scheme. While only relying on examples in the training set, our approach results in increasing accuracy on GSM8K, MATH, and ARC-Challenge for Llama-2-70B-Chat, outperforming other Llama-2-based models not relying on additionally sourced datasets. For example, we see a large improvement from 55.6% to 81.6% on GSM8K and an accuracy of 88.7% with majority voting out of 32 samples.

한국어 요약

한 줄 요약

Iterative Reasoning Preference Optimization (IRPO)는 DPO 기반 수정 손실 함수를 반복적으로 적용하여 Llama-2-70B-Chat의 추론 성능을 GSM8K에서 55.6% → 81.6%로 향상시키는 방법이다.

핵심 기여도

핵심 아이디어

기존의 반복적 선호 최적화 방법은 일반 지시 조정 작업에는 효과적이지만, 추론 작업에서는 성능 향상이 제한적이었다. 본 연구는 CoT 후보를 생성하고, 정답/오답 추론 단계를 비교하는 방식으로 모델을 학습시킨다. 이는 DPO 손실에 NLL 항을 추가하여, 정답 후보에 대한 확률을 높이도록 유도한다. 반복적 학습을 통해 모델은 점점 더 정확한 추론 경로를 학습하게 되며, 이는 추론 성능 향상으로 이어진다. 핵심 아이디어는 **정답 추론 단계에 대한 선호를 반복적으로 최적화**함으로써 모델의 추론 능력을 향상시키는 것이다.

기술적 접근법

주요 결과

의의 및 한계

본 연구는 DPO 기반의 반복적 학습을 추론 작업에 적용한 첫 사례로, 기존의 SFT 중심 접근과 달리 **선호 쌍 최적화**를 통해 추론 능력을 향상시킬 수 있음을 보여준다. 특히, 추가 데이터 없이 기존 훈련셋만 사용하는 점에서 실용적 가치가 높다. 그러나, 반복 횟수에 따라 성능이 포화되는 현상이 관찰되었으며, 이는 추가 연구가 필요한 한계점이다. 또한, 모델 크기와 반복 횟수의 관계, 다양한 추론 작업에서의 일반화 가능성도 추가 실험 대상이다.

실용적 활용

IRPO는 LLM의 추론 능력을 향상시키는 간단한 레시피로, **수학 문제 해결, 논리 추론, 복잡한 질문 응답** 등 다양한 추론 작업에 적용 가능하다. 특히, 추가 데이터 없이 기존 훈련셋만 사용하는 점에서, 데이터 수집이 어려운 산업 현장이나 연구 환경에서도 유용하게 활용될 수 있다.