한 줄 요약
CHAMP은 SMPL 모델을 기반으로 3D 파라메트릭 가이던스를 결합하여 사람 이미지 애니메이션의 형태 정렬과 움직임 지도를 향상시킨다.
핵심 기여도
- SMPL 모델을 사용하여 형태와 자세의 통일된 표현을 구축함으로써, 형태 정렬과 움직임 지도를 동시에 개선.
- 렌더링된 깊이 이미지, 노멀 맵, 세멘틱 맵, 스켈레톤 기반 움직임을 결합하여 라티언트 디퓨전 모델에 3D 형태와 자세 정보를 제공.
- 다층 움직임 퓨전 모듈(Self-attention 기반)을 통해 형태와 움직임의 라티언트 표현을 공간 영역에서 통합.
- 실험 결과, 기존 방법 대비 PSNR 1.27, SSIM 0.10 개선.
핵심 아이디어
기존의 사람 애니메이션 기법은 스켈레톤, 세멘틱 맵, 밀집 움직임 흐름 등 2D 기반의 움직임 지도를 사용하지만, 이는 형태와 자세의 정확한 정렬에 한계가 있었다. CHAMP은 SMPL(Skinned Multi-Person Linear)이라는 3D 파라메트릭 모델을 도입하여, 형태와 자세를 통일된 저차원 파라미터 공간에서 표현함으로써 이 문제를 해결한다. SMPL은 렌더링된 깊이 이미지, 노멀 맵, 세멘틱 맵을 생성하여 3D 형태 정보를 라티언트 디퓨전 모델에 제공하며, 스켈레톤은 얼굴과 손 움직임과 같은 세부 움직임을 보완적으로 가이드한다. 이와 함께, Self-attention 기반의 다층 움직임 퓨전 모듈을 통해 형태와 움직임의 라티언트 표현을 통합하여, 더 정확한 애니메이션 생성이 가능하다.
기술적 접근법
- **SMPL 모델 활용**: SMPL 모델을 사용하여 형태와 자세를 통일된 파라미터 공간에서 표현.
- **렌더링 정보 생성**: 깊이 이미지, 노멀 맵, 세멘틱 맵을 생성하여 3D 형태 정보를 제공.
- **스켈레톤 기반 움직임**: 얼굴, 손 움직임 등 세부 움직임을 보완적으로 가이드.
- **다층 움직임 퓨전 모듈**: Self-attention 기반으로 형태와 움직임의 라티언트 표현을 공간 영역에서 통합.
- **라티언트 디퓨전 모델**: 위 조건 정보를 기반으로 사람 애니메이션을 생성.
- **훈련 및 추론 절차**: SMPL 모델 기반의 형태와 움직임 정보를 사용한 조건부 라티언트 디퓨전 모델 훈련.
주요 결과
- **TikTok, UBC 패션 비디오 데이터셋**에서 높은 품질의 사람 애니메이션 생성 성공.
- **PSNR 1.27, SSIM 0.10** 개선 (기존 방법 대비).
- **SMPL + 스켈레톤 조합**이 개별 조건보다 애니메이션의 형태 정렬과 움직임 정확도를 향상.
- **파라메트릭 형태 정렬**을 통해 참조 이미지와 움직임 영상 간의 형태 일관성 유지.
의의 및 한계
CHAMP은 기존 2D 기반 움직임 지도의 한계를 극복하고, 형태와 자세를 동시에 정확히 표현할 수 있는 3D 파라메트릭 모델 기반의 새로운 접근법을 제시한다. SMPL 모델을 활용한 형태 정렬과 Self-attention 기반의 다층 퓨전 모듈은 사람 애니메이션 생성의 정확도와 일관성을 크게 향상시켰으며, 다양한 실제 환경 데이터에서도 일반화 능력을 보였다. 그러나 SMPL 모델의 정확한 추정이 필요하며, 복잡한 배경이나 옷차림 변화에 대한 처리는 추가 연구가 필요하다.
실용적 활용
CHAMP은 가상 현실(VR), 인터랙티브 스토리텔링, 디지털 콘텐츠 제작 등 사람의 형태와 움직임을 정확히 표현해야 하는 분야에 적용 가능하다. 특히, 사용자 정의 이미지와 움직임을 기반으로 사람 애니메이션을 생성하는 애플리케이션 개발에 유용할 것으로 기대된다.