한 줄 요약
OpenVid-1M은 100만 개 이상의 고품질 텍스트-비디오 쌍을 포함한 대규모 데이터셋으로, MVDiT라는 새로운 다중 모달 디퓨전 트랜스포머를 제안하여 텍스트-비디오 생성을 개선한다.
핵심 기여도
- OpenVid-1M: 100만 개 이상의 고품질 텍스트-비디오 쌍을 포함한 데이터셋.
- OpenVidHD-0.4M: 433K 개의 1080p 고해상도 비디오를 포함한 하위 데이터셋.
- MVDiT: 시각 토큰과 텍스트 토큰에서 정보를 병렬적으로 추출하는 새로운 디퓨전 트랜스포머.
- 텍스트 정보 활용: 기존의 단순 cross attention 대신, self-attention과 multi-head cross-attention을 결합하여 의미 정보를 더 효과적으로 활용.
핵심 아이디어
기존 텍스트-비디오 생성 연구는 WebVid-10M, Panda-70M와 같은 대규모 데이터셋을 사용했지만, 이들은 품질이 낮거나 설명이 부족한 문제가 있었다. OpenVid-1M은 512×512 이상의 해상도를 가지며, LLaVA-v1.6-34b를 사용해 생성된 상세한 캡션을 포함하여 텍스트-비디오 생성의 품질을 높이는 데 기여한다. 또한, MVDiT는 기존 DiT 기반 모델과 달리 병렬적인 시각-텍스트 구조를 도입하여, 시각 토큰의 구조 정보와 텍스트 토큰의 의미 정보를 동시에 추출한다. 이는 기존의 단순 cross attention 모듈이 의미 정보를 충분히 활용하지 못하는 문제를 해결한다.
기술적 접근법
- **OpenVid-1M**: 100만 개 이상의 텍스트-비디오 쌍, 최소 512×512 해상도, LLaVA-v1.6-34b 기반의 상세 캡션 포함.
- **OpenVidHD-0.4M**: 433K 개의 1080p 고해상도 비디오로 구성된 하위 데이터셋.
- **MVDiT**:
- 병렬적인 시각-텍스트 구조.
- 시각 토큰과 텍스트 토큰을 추출한 후, Multi-Modal Self-Attention과 Multi-Head Cross-Attention을 통해 상호작용 강화.
- Multi-Modal Temporal-Attention 모듈을 통해 시간적 일관성을 개선.
- 최종적으로 Feedforward Layer를 통해 비디오 생성.
주요 결과
- OpenVid-1M은 WebVid-10M 대비 훨씬 높은 해상도와 품질을 가지며, Panda-70M보다는 시각적 매력, 시간적 일관성, 명확성 측면에서 우수함.
- MVDiT는 STDiT와 비교하여 텍스트 의미 정보를 더 효과적으로 활용하여, 비디오 품질을 향상시킴.
- OpenVidHD-0.4M은 고해상도 비디오 생성 연구를 촉진하는 데 기여.
의의 및 한계
OpenVid-1M은 텍스트-비디오 생성 분야에서 대규모 고품질 데이터의 부족 문제를 해결하며, MVDiT는 텍스트 의미 정보를 더 잘 활용할 수 있는 새로운 아키텍처를 제시한다. 이는 향후 더 정교한 비디오 생성 모델 개발에 기여할 수 있다. 그러나 모델은 여전히 자연 장면의 복잡한 역학과 움직임을 정확히 모델링하는 데 어려움이 있으며, 이는 더 많은 고품질 데이터와 모델 확장을 통해 개선될 수 있다.
실용적 활용
OpenVid-1M은 연구 기관 및 기업에서 텍스트-비디오 생성 모델 개발에 활용할 수 있으며, 특히 고해상도 비디오 생성, 콘텐츠 자동화, VR/AR 분야에서 활용 가능하다. MVDiT는 텍스트 기반의 시각 콘텐츠 생성을 필요로 하는 산업에서 즉시 적용할 수 있는 기술적 기반을 제공한다.