Vidu S2: Real-Time Interactive, Editable, and Spatial Video Generation

Jintao Zhang, Kai Jiang, Jintao Chen, Xu Wang, Deyuan Liu, Jungang Li, Dechuang Chen, Ming Lin, Jingjiang Zhou, Haopeng Jin, Qi Jia, Xiaohang Wang, Yaole Wang, Zhanqiang Zhang, Ran Li, Zhengkun Huang, Shuyue Xiong, Yuji Wang, Zikun Dai, Hui He, Yang Luo, Mang Ning, Weiqi Feng, Chengyang Ye, Xinyue Lin, Min Zhao, Hongzhou Zhu, Hengkai Tan, Zeyuan Wang, Chendong Xiang, Kaiwen Zheng, Zhijie Deng, Fan Bao, Jianfei Chen, Jun Zhu

arXiv:2609.11638 · 2026-09-15 공개 · arXiv · PDF

video-editing interactive-generation real-time-video digital-avatars spatial-video style-rendering character-replacement background-replacement

Abstract

We present Vidu S2, which comprises Vidu S2-Avatar, a real-time interactive digital-character model, and Vidu S2-Editing, a real-time video editing model. Moreover, we explore the feasibility of real-time spatial video generation for both Vidu S2-Avatar and Vidu S2-Editing. Compared with Vidu S1, Vidu S2-Avatar supports real-time 720p video generation, generation with dynamic references that can be updated at any moment, and stronger instruction following, such as dancing. Vidu S2-Editing supports editing a video stream in real time, including style rendering, clothing replacement, character replacement, and background replacement. Experiments show that Vidu S2 outperforms all baselines. A playable online demo is available at https://vidu.com/vidu-stream.

한국어 요약

한 줄 요약

Vidu S2는 실시간 인터랙티브 아바타 생성과 편집 기능을 갖춘 실시간 영상 생성 모델로, 720p 해상도와 다이내믹 레퍼런스, 강화된 인스트럭션 팔로잉을 지원한다.

핵심 기여도

핵심 아이디어

Vidu S2는 실시간 영상 생성과 편집을 위한 두 가지 주요 모듈, 즉 Vidu S2-Avatar와 Vidu S2-Editing으로 구성된다. Vidu S2-Avatar는 오디오-비주얼 조인트 디퓨전 트랜스포머를 사용하여 레퍼런스 이미지와 조건 정보를 기반으로 영상-오디오를 생성한다. 이 모델은 동적 레퍼런스를 실시간으로 업데이트할 수 있으며, 특히 댄스와 같은 복잡한 동작을 정확히 반영하는 것이 핵심이다.

Vidu S2-Editing은 소스 영상과 선택적 레퍼런스 이미지를 조건으로 하여 조건 지시에 따라 영상을 편집하는 디퓨전 트랜스포머(DiT)를 사용한다. 이 모델은 스타일 전이, 가상 시도, 배경 교체 등 다양한 편집 작업을 실시간으로 처리할 수 있다. 두 모듈 모두 조건 정보와 레퍼런스를 공유하여 일관된 시각적 표현을 유지한다.

기술적 접근법

주요 결과

의의 및 한계

Vidu S2는 실시간 영상 생성과 편집 기술의 한계를 확장하며, 특히 스페이셜 비디오 생성 가능성 탐색이 주목할 만하다. 고해상도와 저지연을 동시에 달성하는 것은 여전히 기술적 도전 과제이며, 특히 헤드셋 환경에서는 시각적 편안함과 동기화가 필수적이다. 또한, 현재 시스템은 고정 뷰 스페이셜 비디오에 제한되며, 패노라마 스페이셜 비디오로의 확장이 필요하다.

실용적 활용

Vidu S2는 메타버스, 가상 쇼핑, 실시간 캐릭터 생성 등 다양한 산업 분야에서 활용 가능하다. 특히, 실시간 인터랙티브 영상 생성 기술은 3D 모델링, 애니메이션 제작, 씬 구축 등의 전통적인 작업을 줄이는 데 기여할 수 있다.