한 줄 요약
엔트로피 최소화(EM)를 통해 라벨 없이도 LLM의 수학, 물리, 코딩 성능을 크게 향상시킬 수 있음을 보인 연구.
핵심 기여도
- **EM-FT**: 라벨 없는 출력을 기반으로 토큰 수준 엔트로피를 최소화하는 미세조정 방법을 제안.
- **EM-RL**: 음의 엔트로피를 유일한 보상으로 사용하는 강화학습 알고리즘으로, 60K 라벨 없이도 GRPO, RLOO와 유사한 성능 달성.
- **EM-INF**: 추론 시 로짓 조정을 통해 파라미터 업데이트 없이도 GPT-4o, Claude 3 Opus 등과 맞먹는 성능을 SciCode 벤치마크에서 보임.
- Qwen-32B 기반 EM-INF는 self-consistency, sequential refinement 대비 3배 이상 효율적.
핵심 아이디어
엔트로피 최소화는 모델이 자신 있는 출력에 더 높은 확률을 집중시키도록 유도함으로써 추론 능력을 향상시키는 접근법이다. 기존 연구는 대부분 라벨 데이터나 파라미터 업데이트를 필요로 했지만, 본 연구는 **라벨 없이도** 모델의 내재된 추론 능력을 효과적으로 발휘할 수 있음을 보인다. 핵심 가정은 "모델이 자신 있을 때 더 정확하다"는 통찰이며, 이는 사전 학습된 LLM이 이미 충분한 능력을 갖추고 있다는 가정에 기반한다.
EM-FT는 미세조정과 유사한 방식으로, **토큰 수준 엔트로피**(Eqn. 2)를 최소화하는 손실 함수를 사용한다. EM-RL은 **음의 엔트로피**(Eqn. 1, 2)를 유일한 보상으로 사용하는 **REINFORCE 알고리즘**을 기반으로 한다. EM-INF는 추론 시 **로짓 조정**을 통해 **토큰 수준 엔트로피**(Eqn. 2)를 줄이는 방식으로, 파라미터 업데이트 없이도 추론 성능을 개선한다.
기술적 접근법
- **EM-FT**: 토큰 수준 엔트로피(Eqn. 2)를 최소화하는 손실 함수를 사용. 라벨 없는 출력을 기반으로 미세조정.
- **EM-RL**: **음의 엔트로피**(Eqn. 1, 2)를 유일한 보상으로 사용. **REINFORCE 알고리즘** 기반.
- **EM-INF**: 추론 시 **토큰 수준 엔트로피**(Eqn. 2)를 줄이기 위해 로짓을 조정. 파라미터 업데이트 없이도 가능.
- **데이터셋**: LeetCode, Minerva, AMC, AIME, UGPhysics, SciCode 등.
- **모델**: Qwen-7B, Qwen-32B, Llama-3.1-8B, Qwen-2.5 등.
- **하이퍼파라미터**: 명시되지 않음.
주요 결과
- **Qwen-7B 기반 EM-RL**은 60K 라벨 없이도 GRPO, RLOO와 **비교하거나 더 우수한 성능**을 보임.
- **Qwen-32B 기반 EM-INF**는 SciCode 벤치마크에서 GPT-4o, Claude 3 Opus, Gemini 1.5 Pro와 **비교하거나 초과**.
- EM-INF는 self-consistency, sequential refinement 대비 **3배 이상 효율적**.
- Llama-3.1-8B는 EM-FT, EM-RL에서 Qwen-2.5 대비 **수학 추론 성능 개선 폭이 작음**.
의의 및 한계
본 연구는 사전 학습된 LLM이 이미 강력한 추론 능력을 내재하고 있으며, 이를 **엔트로피 최소화만으로도 효과적으로 발휘**할 수 있음을 보인다. 이는 추론 성능 향상을 위한 라벨 데이터 의존성을 줄이고, 파라미터 업데이트 없이도 추론을 개선할 수 있는 실용적 방법을 제시한다.
그러나 EM은 모델의 **신뢰도가 정확성과 상관관계가 있을 때에만 효과적**이며, 인간 가치 정렬과 같은 작업에는 적합하지 않다. 또한, 사전 학습 모델이 해당 작업에 충분히 능력 있는 경우에만 EM이 효과적임을 보여주며, Qwen-2.5는 라벨 없이 EM만으로는 개선되지 않는 작업(개인적 가치 추론)에서는 실패함을 관찰했다.
실용적 활용
EM-FT, EM-RL, EM-INF는 추론 성능 향상을 위한 **라벨 데이터 없이도 사용 가능한 강력한 도구**로, 특히 수학, 물리, 코딩 등 **복잡한 추론 작업**에 적용 가능하다. Qwen-32B 기반 EM-INF는 **사전 학습된 모델의 추론 능력을 최대한 활용**하면서도 파라미터 업데이트 없이도 높은 효율성을 보임으로써, **대규모 모델의 추론 최적화**에 유용할 수 있다.