한 줄 요약
182,000개의 인간 선호 데이터를 기반으로 Flow-DPO, Flow-RWR, Flow-NRG를 도입해 비디오 생성 모델의 정렬을 개선한다.
핵심 기여도
- 12개의 최신 비디오 생성 모델을 기반으로 182,000개의 다차원 선호 데이터셋 구축 (VQ, MQ, TA 포함).
- Flow-DPO는 β를 고정하면 Flow-RWR 및 감독 미세조정 대비 우수한 성능 (비교 실험 결과).
- Flow-NRG는 추론 시 여러 목표에 가중치를 적용할 수 있는 효율적 정렬 알고리즘.
- VideoGen-RewardBench라는 26,500개의 비디오 쌍을 포함한 평가 벤치마크 제안.
핵심 아이디어
기존 비디오 생성 모델은 시각 품질(VQ), 움직임 품질(MQ), 텍스트 정렬(TA)에서 불안정한 움직임 및 미스매치 문제가 지속되었다. 이를 해결하기 위해, 연구팀은 인간 선호 데이터를 기반으로 정렬된 비디오 생성 모델을 개발하는 시스템적 파이프라인을 제안한다. 특히, 다차원 선호 데이터셋을 구축하고, 이를 기반으로 VideoReward라는 다차원 보상 모델을 제안한다. Flow-DPO, Flow-RWR, Flow-NRG는 흐름 기반 모델에 적용 가능한 정렬 알고리즘으로, Flow-DPO는 KL 정규화를 통해 β 값을 고정함으로써 훈련 시 더 나은 성능을 보인다. Flow-NRG는 추론 시 노이즈 비디오에 직접 보상 가이드를 적용하여 사용자 맞춤형 품질 조정이 가능하다는 점에서 혁신적이다.
기술적 접근법
- **데이터셋**: 12개의 최신 비디오 생성 모델을 기반으로 182,000개의 다차원 선호 데이터셋 구축 (VQ, MQ, TA).
- **VideoReward**: 다차원 보상 모델로, Bradley-Terry-With-Tied(BTT) 모델이 BT 모델 대비 Ties-included 정확도에서 10% 이상 개선.
- **Flow-DPO**: KL 정규화 기반 강화 학습 알고리즘. β 값을 고정하면 훈련 성능 향상.
- **Flow-NRG**: 추론 시 노이즈 비디오에 보상 가이드 적용. 사용자 정의 가중치 부여 가능.
- **하이퍼파라미터**: β_t = β(1-t)^2로 시간에 따라 KL 제약 조정. 그러나 실험적으로 β를 고정하는 것이 더 효과적임을 밝힘.
주요 결과
- **VideoReward**: 기존 보상 모델 대비 10% 이상 우수한 성능 (BTT 모델 기준).
- **Flow-DPO**: β를 고정한 경우 Flow-RWR 및 감독 미세조정 대비 5% 이상 성능 개선.
- **Flow-NRG**: TA-Hard 프롬프트에서 노이즈 레이턴트 기반 보상 모델이 클리닝 레이턴트 기반 모델 대비 15% 이상 성능 향상.
- **VideoGen-RewardBench**: 26,500개의 비디오 쌍을 포함한 평가 벤치마크 제안.
의의 및 한계
이 연구는 비디오 생성 모델의 인간 선호 정렬 문제를 체계적으로 다루는 데 기여하며, 특히 흐름 기반 모델에 적합한 정렬 알고리즘을 제안한 점에서 학술적·실용적 가치가 있다. VideoReward와 Flow-DPO, Flow-NRG는 사용자 맞춤형 비디오 생성을 가능하게 하며, 기존의 CLIP 점수나 FID 기반 평가 방식의 한계를 극복할 수 있다. 그러나 β_t의 시간에 따른 조정이 실험적으로 부적절하다는 점, 그리고 Flow-DPO가 특정 작업에서 성능 저하를 보이는 한계가 존재한다. 또한, 데이터셋은 12개의 모델에 기반하므로 더 다양한 모델을 포함하는 확장이 필요하다.
실용적 활용
이 연구는 영상 제작, 콘텐츠 생성, 광고 산업 등에서 사용자 맞춤형 비디오 생성을 가능하게 하며, 특히 텍스트-비디오 생성 시 정확한 움직임과 텍스트 정렬이 필요한 상황에서 활용 가능하다. Flow-NRG는 재훈련 없이 사용자 요구에 따라 가중치를 조정할 수 있어, 실시간 또는 반복적 생성 작업에서 유용하다.