한 줄 요약
Video DeltaNet(VDN)은 영상 생성 속도를 14.5× 향상시키는 하이브리드 어텐션 구조를 제안한다.
핵심 기여도
- VDN은 로컬 Softmax 어텐션과 양방향 선형 메모리(VDA)를 결합한 하이브리드 어텐션 구조를 제시한다.
- VDA는 프레임 단위로 공간 토큰을 병렬 처리하는 Video Delta Attention을 도입하여, 14.5× 가속 성능을 달성한다.
- 8단계 디스틸레이션과 최적화된 SGLang 인퍼런스 스택을 통해 14.3초, 768p 영상 생성에 6.7초 소요.
- 기존 50단계 Dense H3 대비 8단계 VDN-H3가 품질 저하 없이 유사한 성능을 보인다.
핵심 아이디어
기존 영상 생성 모델에서 Softmax 어텐션은 토큰 수에 비례해 계산 복잡도가 급증하며, 선형 어텐션은 장거리 컨텍스트를 고정 크기 메모리로 압축해 성능을 향상시킬 수 있다. 그러나 단일 토큰 기반의 업데이트 방식은 영상의 공간적 상관성을 무시하게 되어 생성 품질이 저하된다. VDN은 이 문제를 해결하기 위해 프레임 단위로 공간 토큰을 병렬 처리하는 VDA를 도입한다. VDA는 키-밸류 간 상관관계를 고려해 메모리 업데이트를 수행하며, RMS 정규화와 학습 가능한 게이트를 통해 두 가지 어텐션 경로를 조절한다. 또한, 기존 미리 학습된 모델에 새로운 선형 경로를 점진적으로 통합하는 staged teacher-alignment 레시피를 제안한다.
기술적 접근법
- **VDN-H3**: MiniMax H3에 VDN을 적용한 모델로, 영상-영상 상호작용에는 하이브리드 어텐션을, 텍스트/오디오 상호작용에는 Softmax를 유지.
- **VDA (Video Delta Attention)**: 프레임 단위로 토큰을 병렬 처리하며, 키-밸류 상관관계를 고려한 메모리 업데이트.
- **RMS 정규화**와 **학습 가능한 게이트**를 사용해 두 어텐션 경로의 출력을 조정.
- **Staged teacher-alignment 레시피**: 기존 모델과 새로운 경로를 점진적으로 통합하며, low-rank 업데이트와 few-step 디스틸레이션을 적용.
- **하이퍼파라미터**: 8단계 디스틸레이션, 8개의 NVIDIA B200 GPU 사용.
주요 결과
- 14.3초, 768p 영상 생성 시, VDN-H3는 8개의 B200 GPU에서 6.70초 소요.
- 50단계 Dense H3 대비 14.5× 가속.
- 8단계 VDN-H3는 50단계 Dense H3와 유사한 품질을 유지하며, 4단계 FastH3보다 명확한 성능 우위를 보임.
- Window Softmax 최적화로 B200에서 69.5ms → 56.1ms, H200은 112.6ms → 112.1ms 개선.
의의 및 한계
VDN은 영상 생성에서 Softmax 어텐션의 계산 복잡도 문제를 해결하면서도 품질 저하 없이 성능을 향상시킨다. 특히, VDA는 영상의 공간적 상관성을 고려한 병렬 처리를 통해 기존 선형 어텐션의 한계를 극복한다. 또한, staged teacher-alignment 레시피는 기존 모델과 새로운 경로의 통합을 용이하게 하며, 디스틸레이션과 최적화를 통해 실용적인 속도 향상이 가능하다. 그러나 VDN은 텍스트/오디오 상호작용에는 여전히 Softmax를 사용하므로, 모든 상호작용에 선형 어텐션을 적용하는 방법은 아직 검증되지 않았다.
실용적 활용
VDN은 실시간 스트리밍 영상 생성, 대규모 영상 생성 작업, GPU 리소스 제한 환경에서 빠른 인퍼런스가 필요한 산업에 적용 가능하다. 특히, 미디어 제작, 게임 콘텐츠 생성, 영상 기반 챗봇 등에서 실시간 성능 향상과 품질 유지가 요구되는 상황에 유용하다.