한 줄 요약
RADD는 시간 조건을 제거한 이산 확장 확산 모델로, 5개 제로샷 언어 모델링 벤치마크에서 최고 성능을 달성했다.
핵심 기여도
- RADD는 concrete score를 clean data의 조건부 확률과 시간에 따른 스칼라의 곱으로 분해함.
- RADD는 시간 조건을 제거하고, time-independent conditional probability를 모델링함.
- 캐싱 전략을 통해 NFEs(함수 평가 수)를 줄여 샘플링 속도를 향상시킴.
- 5개 제로샷 언어 모델링 벤치마크에서 perplexity 기준 SOTA 성능 달성 (GPT-2 규모).
핵심 아이디어
기존 이산 확산 모델에서 추정해야 하는 concrete score는 두 transitive 상태의 주변 확률 비율로 정의되는데, 본 연구는 이를 clean data의 조건부 확률과 시간에 따른 스칼라의 곱으로 분해할 수 있음을 이론적으로 밝혔다. 이는 기존의 "scaling trick"이 실제로는 최적화를 위한 재매개변수화임을 설명한다. 이를 바탕으로 RADD는 시간 조건을 제거하고, time-independent conditional probability를 직접 모델링하는 새로운 확산 모델을 제안한다. 이는 모델 복잡도를 줄이고, 샘플링 과정에서 동일한 노이즈 샘플이 유지되는 구간에서는 네트워크 출력을 캐싱함으로써 NFEs를 감소시킨다.
기술적 접근법
- **RADD (Reparameterized Absorbing Discrete Diffusion)**: 시간 조건을 제거한 확산 모델.
- **Concrete score 분해**: clean data의 조건부 확률 × 시간에 따른 스칼라.
- **캐싱 전략**: 샘플링 구간 내 노이즈 샘플이 변하지 않을 때, 네트워크 출력을 재사용하여 NFEs 감소.
- **t-DCE (t-Denoising Cross-Entropy)**: 확산 모델의 훈련 목적 함수를 AO-ARMs와 동일한 형태로 변환.
- **AO-ARMs와의 통합**: 확산 모델의 상한 음의 로그 우도가 AO-ARMs의 기대 음의 로그 우도와 동일함을 증명 (Theorem 2).
주요 결과
- **5개 제로샷 언어 모델링 벤치마크**에서 RADD는 perplexity 기준 기존 확산 모델 중 최고 성능 달성 (GPT-2 규모).
- **NFEs 감소**: 캐싱 전략을 통해 샘플링 속도 향상.
- **수렴 속도 향상**: SEDD 대비 빠른 수렴을 보임.
- **t-DCE 목적 함수**: AO-ARMs와 동일한 훈련 목적 함수로 모델 성능 향상.
의의 및 한계
RADD는 이산 확산 모델의 이론적 이해를 깊이 있게 확장하며, 기존의 scaling trick을 재매개변수화로 해석함으로써 실용적 가이드를 제공한다. 또한, 확산 모델과 AO-ARMs의 훈련 목적 함수를 통합함으로써 새로운 이론적 통찰을 제시한다. 그러나 RADD는 시간 조건을 제거함으로써 특정 시점의 노이즈 변화를 고려하지 못할 수 있으며, 이는 복잡한 시퀀스 생성에 한계가 있을 수 있다. 또한, 제로샷 성능은 모델 규모(GPT-2)에 기반하므로, 더 큰 모델에서는 결과가 달라질 수 있다.
실용적 활용
RADD는 고속 샘플링과 병렬 훈련이 가능한 언어 생성 모델로, 대규모 언어 모델링, 제로샷 텍스트 생성, 프롬프트 기반 생성 등에 활용 가능하다. 특히, NFEs 감소를 통해 실시간 응용(예: 챗봇, 자동 번역)에도 유용할 수 있다.