한 줄 요약
VideoRAE는 Video Foundation Models(VFMs)의 냉동 표현을 활용하여 고정밀 비디오 생성을 지원하는 새로운 표현 오토인코더를 제안한다.
핵심 기여도
- VideoRAE는 V-JEPA 2와 VideoMAEv2의 냉동 표현을 기반으로, 1D self-attention projector를 사용해 높은 압축률의 비디오 레이턴트를 생성한다.
- Multi-codebook SimVQ를 통해 연속 레이턴트와 이산 토큰을 모두 지원하며, gFVD 40 (AR)과 93 (DiT)의 최고 성능을 달성한다.
- Local-and-global representation alignment objective를 도입하여 KL 정규화 없이도 의미 보존을 달성하고, 5× 빠른 수렴 속도를 보인다.
- UCF-101, TokenBench, VBench 데이터셋에서 뛰어난 재구성 및 생성 성능을 입증한다.
핵심 아이디어
기존 3D-VAE는 픽셀 수준 재구성을 최적화하여 의미적 구조와 시공간 동작을 제대로 포착하지 못한다. 반면, VFMs는 강력한 의미 추출 능력을 가지지만, 이 냉동 표현이 생성 모델링에 적합한 레이턴트로 변환될 수 있는지는 여전히 탐구되지 않았다. VideoRAE는 이 문제를 해결하기 위해, V-JEPA 2와 VideoMAEv2의 냉동 표현을 활용하고, 1D self-attention projector로 높은 압축률의 레이턴트를 생성한다. 이 레이턴트는 Multi-codebook SimVQ를 통해 이산 토큰으로 변환되며, Local-and-global representation alignment objective를 통해 의미 구조를 보존한다. 이는 KL 정규화 없이도 안정적인 학습을 가능하게 하며, Diffusion Transformer(DiT)와 Autoregressive(AR) 모델 모두에 적용 가능하다.
기술적 접근법
- **Encoder**: V-JEPA 2와 VideoMAEv2의 냉동 표현을 사용.
- **Feature Aggregation**: Layer 8–24의 다중 스케일 특성을 결합.
- **Projector**: 1D self-attention을 사용해 3D 특성을 512 또는 1024개의 레이턴트 토큰으로 압축.
- **Quantization**: Multi-codebook SimVQ (K=4, V=4096)를 사용해 이산 토큰 생성.
- **Decoder Objective**: Local-and-global representation alignment objective를 도입하여 KL 정규화 없이 의미 보존.
- **하이퍼파라미터**: 연속 레이턴트는 32/64 차원, 이산 레이턴트는 512 차원의 고차원 정량화.
주요 결과
- **UCF-101**: AR 생성기에서 gFVD 40, DiT 생성기에서 gFVD 93 달성.
- **수렴 속도**: 기존 오토인코더 대비 약 5× 빠르게 수렴.
- **TokenBench**: 이산 재구성에서 최고 성능.
- **VBench**: LTX-VAE 대비 빠른 수렴과 더 높은 VBench 점수.
- **Quantization 실험**: Multi-codebook SimVQ가 gFVD 40 (이산), 93 (연속)을 달성하며, VQ 대비 27% 개선.
의의 및 한계
VideoRAE는 VFMs의 냉동 표현을 생성 모델링에 직접 활용할 수 있음을 입증하며, 기존 VAE 기반 토크나이저의 한계를 극복한다. 특히, Local-and-global alignment objective를 통해 KL 정규화 없이도 의미 구조를 유지하는 것이 학술적 기여로 작용한다. 또한, 5× 빠른 수렴 속도는 대규모 생성 모델 학습에 실질적 효율성을 제공한다. 그러나, 현재 실험은 UCF-101과 TokenBench 중심이며, 더 복잡한 동작이나 장기적 시공간 구조를 포착하는 데 한계가 있을 수 있다. 또한, 높은 차원의 정량화는 메모리 사용량 증가를 유발할 수 있다.
실용적 활용
VideoRAE는 텍스트-비디오 생성, 클래스-비디오 생성, 그리고 대규모 비디오 생성 프레임워크에서 활용 가능하다. 특히, LTX-VAE 대체로 사용될 경우, 빠른 수렴과 높은 생성 품질을 동시에 달성할 수 있어, 산업적 응용에서 효율성과 품질을 동시에 요구하는 시나리오에 적합하다.