한 줄 요약
TCR은 스크립트 기반 동영상 생성에서 비디오와 오디오의 타이밍을 스크립트와 정확히 맞추는 기술로, Shot Boundary MAE 96% 감소, Dialogue [email protected] 84.1% 달성.
핵심 기여도
- 스크립트의 타이밍 정보를 비디오-오디오 공유 시간 축에 매핑하여 **Temporal Context Routing (TCR)** 모듈을 제안.
- **Shot Boundary MAE** 1.11s → 0.042s (96% 감소), **Dialogue [email protected]** 28.3% → 84.1% 향상.
- **Coarse-to-fine 데이터 생성 파이프라인**을 통해 정밀한 타이밍 정보를 학습에 반영.
- 사용자 설문조사에서 5개 평가 항목 전부에서 TCR이 선호됨.
핵심 아이디어
기존의 비디오-오디오 생성 모델은 공유 시간 축에서 동작하지만, 스크립트에 명시된 씬 전환과 대사 타이밍은 텍스트 조건에만 포함되어 있어, 실제 생성물과 스크립트 사이의 시간 차이가 발생했다. 이 문제를 해결하기 위해 TCR은 각 텍스트 프롬프트의 시간 정보를 **공유 시간 축**에 매핑하고, 해당 시간 위치에 맞춰 **비디오-텍스트 및 오디오-텍스트 크로스 어텐션 로짓에 라우팅 점수를 추가**하는 방식을 도입했다. 이는 프롬프트별로 독립적으로 시간 제어가 가능하도록 하며, 기존 텍스트, 쿼리, 키 표현을 수정하지 않아 시각 품질과 오디오-비디오 동기화를 유지할 수 있다.
기술적 접근법
- **Temporal Context Routing (TCR)**: 각 프롬프트의 시간 정보를 **duration-normalized routing score**로 변환하여, 비디오-텍스트 및 오디오-텍스트 크로스 어텐션 로짓에 추가.
- **Coarse-to-fine 데이터 생성 파이프라인**: Gemini를 사용해 스크립트 스키마에 맞는 의미적 어노테이션과 초기 타이밍을 생성한 후, **0.1초 격자**로 정밀화.
- **Gaussian Interval RoPE, Hard Interval Mask**와 비교 실험 수행.
- **Shot Boundary MAE**, **Dialogue [email protected]**, **Shot IoU**, **WER**, **Sync-C** 등 다양한 메트릭 사용.
주요 결과
- **200개 테스트 스크립트**에서 TCR은 Shot Boundary MAE를 1.11s → 0.042s (96% 감소), Dialogue [email protected]를 28.3% → 84.1% 향상.
- **Gaussian Interval RoPE** 대비 Shot Boundary MAE 60% 이상 감소.
- **Hard Interval Mask** 대비 Dialogue [email protected] 84.1% vs 83.7%로 가장 높음.
- 사용자 설문조사에서 **Shot Timing, Dialogue Timing, Script Fidelity, Audio-Visual Sync, Overall Quality** 5개 항목 전부에서 선호됨.
의의 및 한계
TCR은 스크립트 기반 생성에서 **정확한 시간 제어**를 가능하게 하며, 기존 시각 품질과 오디오-비디오 동기화를 유지하면서도 스크립트와의 일치도를 높인다. 이는 드라마, 광고 등 구조화된 콘텐츠 제작에 큰 기여를 할 수 있다. 그러나 TCR은 **정밀한 어노테이션 데이터**가 필요하며, **코어스 타이밍 정보**를 사용하면 성능이 크게 저하되는 한계가 있다. 또한, 현재는 **0.1초 단위의 격자 기반 타이밍**만 지원하며, 더 세밀한 제어는 추가 연구가 필요하다.
실용적 활용
TCR은 **쇼트폼 드라마, 광고, 인터랙티브 콘텐츠 제작** 등 스크립트 기반 동영상 생성이 필요한 산업에 적용 가능하다. 특히, 대사와 씬 전환의 정확한 타이밍이 요구되는 **드라마 제작, 캐릭터 애니메이션, 게임 내 콘텐츠 생성** 분야에서 유용하게 사용될 수 있다.