한 줄 요약
JoyAI-Video-Edit는 실시간 오픈엔드 동영상 편집을 위한 16B 파라미터 자동회귀 확산 모델로, 30 FPS의 처리 속도를 달성한다.
핵심 기여도
- **Chunk-wise autoregressive adaptation**과 **Source-Anchored Distribution Matching Distillation (SA-DMD)**, **Long-Horizon Autoregressive Distillation**을 결합하여 훈련-추론 불일치와 시간적 드리프트를 완화.
- **720p 영상 편집**을 단일 **Nvidia B200 GPU**에서 약 30 FPS로 처리, 실시간 성능 확보.
- **LongV2VBench**라는 장시간 동영상 편집 벤치마크를 제안하여 지속적인 스트리밍 환경에서의 평가를 가능하게 함.
핵심 아이디어
JoyAI-Video-Edit은 기존 오프라인 편집 모델의 양방향 처리와 고정 길이 입력의 한계를 극복하기 위해, **자동회귀 확산 프레임워크**를 기반으로 설계되었다. 이 모델은 **각 청크 내에서 양방향 어텐션**, **청크 간 인과적 연결**을 통해 시간 상태를 제한하고, **슬라이딩 윈도우**를 통해 메모리 사용량을 고정한다. 또한, **Source-Anchored Distribution Matching Distillation (SA-DMD)**를 통해 편집된 영상의 출처 신뢰도를 유지하면서, **Long-Horizon Autoregressive Distillation**을 통해 오랜 시간 동안 누적된 오류를 최소화한다. 이는 실시간 편집에서 필수적인 **저지연**, **고정된 계산 리소스**, **시간적 일관성**을 모두 달성하는 핵심 기술이다.
기술적 접근법
- **모델 아키텍처**: MLLM 기반 조건 인코더, 인과적 비디오 VAE, 멀티모달 확산 트랜스포머(MM-DiT)로 구성.
- **Causal VAE**: 8×24×24의 시공간 압축 비율을 사용하여 8개의 비디오 프레임을 하나의 잠재 프레임으로 압축.
- **SLIDING WINDOW**: 최근 청크와 첫 번째 청크를 포함한 고정 크기의 윈도우로 시간 상태를 제한.
- **SA-DMD**: 텍스트 조건과 출처 신뢰도 축을 따라, 편집된 영상의 드리프트를 억제.
- **Long-Horizon Autoregressive Distillation**: 확장된 롤아웃에서 분할 최적화를 통해 누적 오류를 직접 감시.
- **훈련 전략**: 청크 단위 자동회귀 적응, 클린 히스토리 교사 강요 → 모델 생성 추정치로 교체하는 재샘플링 강요를 사용.
주요 결과
- **720p 영상 편집**에서 단일 **Nvidia B200 GPU**에서 약 **30 FPS** 처리 성능 달성.
- **LongV2VBench** 데이터셋에서 기존 스트리밍 에디터 대비 **자동 평가 및 인간 평가 모두에서 상당한 성능 개선**.
- **장시간 영상**에서도 편집 일관성과 출처 신뢰도를 유지하며, 오프라인 시스템과 **경쟁력 있는 성능** 보임.
의의 및 한계
JoyAI-Video-Edit은 실시간 스트리밍 환경에서 **인과적 출력**, **저지연**, **고정 메모리 사용**, **시간적 일관성**을 동시에 달성한 첫 번째 모델로, **라이브 방송**, **인터랙티브 엔터테인먼트**, **실시간 콘텐츠 제작** 등 다양한 분야에 적용 가능하다. 또한, **Long-Horizon Autoregressive Distillation**과 **SA-DMD**는 실시간 편집에서의 오류 누적 문제를 해결하는 학술적 기여가 있다. 그러나, **고해상도 영상**(예: 1080p 이상) 처리나 **복잡한 다중 객체 편집**에 대한 평가는 **명시되지 않음**.
실용적 활용
JoyAI-Video-Edit는 **라이브 방송 스트리밍**, **실시간 영상 커뮤니케이션**, **인터랙티브 게임 영상 제작** 등에서 즉각적인 편집이 필요한 상황에 적용 가능하다. 특히, **단일 GPU 기반의 실시간 처리**는 클라우드 기반 또는 모바일 환경에서도 활용 가능성을 열어준다.