한 줄 요약
마스킹 확산 모델(MDM)의 토큰 순서 결정 전략이 추론 성능에 미치는 영향을 분석하고, 적응적 추론이 성능을 7%에서 90%까지 향상시킴을 보인다.
핵심 기여도
- MDM이 훈련 시 지수적으로 복잡한 서브문제를 학습함을 이론적으로 증명.
- 적응적 추론 전략이 MDM의 추론 성능을 7%에서 90%까지 향상.
- 7배 더 많은 파라미터를 가진 ARMs보다 뛰어난 성능 달성.
- 토큰 순서가 MDM의 학습 및 추론 성능에 결정적 역할을 함을 실증.
핵심 아이디어
MDM은 훈련 시 모든 가능한 마스킹 패턴을 학습해야 하므로, ARMs보다 훨씬 복잡한 서브문제를 풀어야 한다. 이는 이론적으로 계산 불가능한 수준의 복잡도를 가진다. 그러나 추론 시 토큰 순서를 자유롭게 조정할 수 있는 유연성이 MDM의 강점이다. 본 연구는 이 유연성을 활용한 적응적 추론 전략(예: Top-K 확률 마진 기반)을 제안하고, 이를 통해 훈련 시 학습하지 못한 순서 문제를 우회할 수 있음을 보인다. 특히, 수학 퍼즐(Sudoku)에서 이 접근법이 성능을 극적으로 향상시킴을 실험적으로 입증했다.
기술적 접근법
- **모델**: MDM과 ARMs 비교.
- **추론 전략**: Top-K 확률 마진 기반의 적응적 토큰 순서 결정.
- **훈련 설정**: AdamW 최적화기, β₁=0.9, β₂=0.95, weight decay=0.1, 최대 학습률 4×10⁻⁴, 최소 학습률 4×10⁻⁵, L=2048.
- **데이터**: 텍스트 및 논리 퍼즐(Sudoku) 사용.
- **하이퍼파라미터**: RoPE 대신 학습 가능한 위치 임베딩 사용.
주요 결과
- **Sudoku 데이터셋에서 MDM의 정확도**: 7% → 90% (적응적 추론 적용 시).
- **ARMs 대비 성능**: 7배 더 많은 파라미터를 가진 ARMs보다 뛰어난 성능.
- **복잡도 분석**: 훈련 시 MDM이 지수적으로 많은 서브문제를 학습해야 함.
- **추론 유연성**: 토큰 순서를 자유롭게 조정 가능.
의의 및 한계
본 연구는 MDM의 훈련 복잡도와 추론 유연성의 균형을 분석하고, 적응적 추론 전략이 MDM의 성능을 극적으로 향상시킬 수 있음을 보인다. 이는 MDM이 ARMs의 강점을 보완할 수 있음을 시사하며, 특히 추론 단계에서의 유연성이 핵심 가치로 작용함을 강조한다. 그러나 현재 제안된 적응 전략은 Top-K와 같은 간단한 알고리즘에 의존하며, 더 복잡한 상황에서는 한계가 있을 수 있다.
실용적 활용
MDM과 적응적 추론 전략은 자연어 생성, 코드 생성, 논리 추론, 텍스트 인필링 등에서 활용 가능하다. 특히, 순서에 민감한 작업(예: 퍼즐 해결, 계획 수립)에서 MDM의 유연성이 실질적 이점을 제공할 수 있다.