한 줄 요약
Vidu S2는 실시간 인터랙티브 아바타 생성과 편집 기능을 갖춘 실시간 영상 생성 모델로, 720p 해상도와 다이내믹 레퍼런스, 강화된 인스트럭션 팔로잉을 지원한다.
핵심 기여도
- Vidu S2-Avatar는 실시간 720p 영상 생성, 실시간 업데이트 가능한 다이내믹 레퍼런스, 댄스 등 강화된 인스트럭션 팔로잉을 지원.
- Vidu S2-Editing은 스타일 전이, 가상 시도, 캐릭터/배경 교체를 포함한 실시간 영상 편집 기능 제공.
- 실시간 스페이셜 비디오 생성 가능성 탐색.
- 기존 Vidu S1 대비 향상된 성능과 기능 확장.
핵심 아이디어
Vidu S2는 실시간 영상 생성과 편집을 위한 두 가지 주요 모듈, 즉 Vidu S2-Avatar와 Vidu S2-Editing으로 구성된다. Vidu S2-Avatar는 오디오-비주얼 조인트 디퓨전 트랜스포머를 사용하여 레퍼런스 이미지와 조건 정보를 기반으로 영상-오디오를 생성한다. 이 모델은 동적 레퍼런스를 실시간으로 업데이트할 수 있으며, 특히 댄스와 같은 복잡한 동작을 정확히 반영하는 것이 핵심이다.
Vidu S2-Editing은 소스 영상과 선택적 레퍼런스 이미지를 조건으로 하여 조건 지시에 따라 영상을 편집하는 디퓨전 트랜스포머(DiT)를 사용한다. 이 모델은 스타일 전이, 가상 시도, 배경 교체 등 다양한 편집 작업을 실시간으로 처리할 수 있다. 두 모듈 모두 조건 정보와 레퍼런스를 공유하여 일관된 시각적 표현을 유지한다.
기술적 접근법
- **Vidu S2-Avatar**: 오디오-비주얼 조인트 디퓨전 트랜스포머를 사용. 레퍼런스 이미지와 조건 시퀀스 $ \bm{c}^{1:N} $를 기반으로 노이즈 영상-오디오 레이턴트 $ \bm{x}_t^{1:N} $를 복원.
- **Vidu S2-Editing**: 디퓨전 트랜스포머(DiT)를 사용. 소스 영상 $ \bm{s}^{1:N} $, 레퍼런스 이미지 $ \bm{r} $, 조건 시퀀스 $ \bm{c}^{1:\infty} $를 결합하여 노이즈 타겟 영상 레이턴트 $ \bm{x}_t^{1:N} $를 복원.
- **배경 안정화 연산자**: 카메라 회전과 초점 조정에 기반한 기하학적 변환을 통해 배경 움직임을 보정.
- **하이퍼파라미터**: 명시되지 않음.
주요 결과
- Vidu S2-Avatar는 720p 해상도로 실시간 영상 생성 가능.
- Vidu S2-Editing은 스타일 전이, 가상 시도, 배경 교체 등 실시간 편집 성능 향상.
- 실험 결과, Vidu S2는 모든 베이스라인 모델을 초과함.
- 명시된 수치: 명시되지 않음.
의의 및 한계
Vidu S2는 실시간 영상 생성과 편집 기술의 한계를 확장하며, 특히 스페이셜 비디오 생성 가능성 탐색이 주목할 만하다. 고해상도와 저지연을 동시에 달성하는 것은 여전히 기술적 도전 과제이며, 특히 헤드셋 환경에서는 시각적 편안함과 동기화가 필수적이다. 또한, 현재 시스템은 고정 뷰 스페이셜 비디오에 제한되며, 패노라마 스페이셜 비디오로의 확장이 필요하다.
실용적 활용
Vidu S2는 메타버스, 가상 쇼핑, 실시간 캐릭터 생성 등 다양한 산업 분야에서 활용 가능하다. 특히, 실시간 인터랙티브 영상 생성 기술은 3D 모델링, 애니메이션 제작, 씬 구축 등의 전통적인 작업을 줄이는 데 기여할 수 있다.