한 줄 요약
4DAnyone은 단일 카메라 영상에서 4D 인간을 재구성하는 프레임워크로, RCP와 TCR을 통해 다중 뷰 일관성을 달성한다.
핵심 기여도
- **Reference Context Packing (RCP)**: 생성된 뷰 수에 따른 복잡도를 $O(N)$에서 $O(1)$로 줄여 일관된 외관 가이드를 유지.
- **Target Context Routing (TCR)**: 고노이즈 단계에서 뷰 그룹 간 정보 공유를 통해 구조 드리프트 감소.
- **3D-aware skeleton conditioning**: 깊이 버퍼링을 사용해 2D 포즈 모호성을 해소, 기하 일관성 향상.
- **MVGameHuman 데이터셋**: 인하우스 게임 엔진을 활용한 합성 데이터셋으로 야외 환경에서의 일반화 성능 향상.
핵심 아이디어
기존 카메라 제어형 비디오 생성 모델은 4DGS 재구성을 위한 수십 개의 뷰를 생성할 때 일관성을 유지하지 못한다. 이는 단일 DiT 패스의 어텐션 컨텍스트가 제한되어, 뷰 수가 늘어날수록 **reference-context 복잡도가 $O(N)$**으로 증가하고, **target-context는 그룹 간 정보 교환 불가**로 구조 드리프트가 발생하기 때문이다. 4DAnyone은 이 두 병목 현상을 해결하기 위해 RCP와 TCR을 제안한다. RCP는 외관의 중복성을 활용해 컨텍스트를 고정 길이로 압축하고, TCR은 디퓨전 단계의 시간 구조를 활용해 뷰 그룹 간 정보 공유를 동적으로 조절한다.
기술적 접근법
- **Reference Context Packing (RCP)**: 생성된 뷰를 고해상도와 저해상도를 혼합한 고정 길이 컨텍스트로 압축, $O(N)$ → $O(1)$ 복잡도 감소.
- **Target Context Routing (TCR)**: 고노이즈 단계에서는 뷰 그룹을 회전하며 정보 공유, 저노이즈 단계에서는 인접 뷰 그룹 고정으로 세부 안정화.
- **3D-aware skeleton conditioning**: 깊이 버퍼링된 3D 스켈레톤 렌더링을 조건으로 사용, 2D 포즈 모호성 해소.
- **MVGameHuman 데이터셋**: 인하우스 게임 엔진 + 라이트스테이지 + 야외 비디오 데이터셋 결합, 총 8개 시퀀스, 16개 카메라, 121프레임 사용.
주요 결과
- **DNA-Rendering**과 **DyMVHumans** 데이터셋에서 4DAnyone은 기존 방법 대비 **비디오 품질과 4DGS 재구성 성능 모두 개선**.
- **RCP와 TCR 제거 시 모든 메트릭 악화**, 특히 TCR 제거 시 구조 드리프트 증가.
- **Sliding 라우팅 전략**이 모든 메트릭에서 개선, Random과 Strided는 성능 저하.
- **3D-aware skeleton conditioning**은 기하 일관성을 2D 렌더링 대비 향상.
의의 및 한계
4DAnyone은 단일 카메라 영상에서 4DGS 재구성을 가능하게 하며, **실시간 렌더링과 가상 현실 분야에서 활용 가능**하다. 특히, **RCP와 TCR을 통해 대규모 뷰 생성 시 일관성을 유지**하는 것이 학술적 기여다. 그러나, **입력 영상의 품질과 스켈레톤 추정 정확도에 의존**하며, **복잡한 배경이나 다중 인물 상황에서 일반화 성능이 저하될 수 있다**는 한계가 있다.
실용적 활용
4DAnyone은 **가상 캐릭터 생성, 게임 콘텐츠 제작, VR/AR 환경에서의 실시간 4D 렌더링**에 적용 가능하다. 특히, **사용자 영상만으로 4D 모델을 생성**할 수 있어, **사용자 맞춤형 콘텐츠 제작**에 유용하다.