한 줄 요약
Kirin은 자연 상태의 동영상에서 동물 움직임을 생성하는 첫 번째 대규모 데이터셋과 모델을 제시한다.
핵심 기여도
- AiM3D: 동영상-텍스트-움직임 튜플이 정렬된 첫 번째 대규모 4족 동물 데이터셋.
- 텍스트와 이미지 조건을 동시에 사용하는 동물 움직임 생성 모델 제안.
- 기존 4D 애니메이션 방법 대비 더 높은 성능을 보이는 자동 3D 메시 애니메이션 파이프라인.
- 이미지 조건이 FID +12.3%, R-Precision +7.1% 개선을 유도함.
핵심 아이디어
Kirin은 기존 연구가 제한적인 동물 움직임 데이터로 인해 발전이 느렸다는 문제를 해결하기 위해, 인터넷 동영상에서 직접 3D 움직임을 재구성하고 이를 텍스트와 결합한 AiM3D 데이터셋을 구축했다. 이 데이터셋을 기반으로 텍스트와 이미지 조건을 동시에 사용하는 MDM 기반의 생성 모델을 학습하여, 다양한 동물 종에 걸쳐 현실적인 움직임을 생성한다. 기존 연구는 주로 합성 또는 수작업 데이터에 의존했지만, Kirin은 자연 상태의 동영상에서 직접 학습함으로써 더 다양한 움직임 패턴을 포착할 수 있다. 또한, 이미지-3D 변환 모듈을 활용해 생성된 움직임을 3D 메시에 자동으로 적용하여, 렌더링 가능한 애니메이션을 생성한다.
기술적 접근법
- **AiM3D 데이터셋**: 인터넷 동영상에서 3D 움직임을 재구성하고, VLM을 활용해 텍스트 설명을 생성하여, 동영상-텍스트-움직임 튜플을 구성.
- **MDM 기반 생성 모델**: 텍스트와 이미지 조건을 동시에 사용하는 MDM(Motion Diffusion Model) 기반의 모델.
- **이미지 조건 분기**: 모델 내부에 이미지 조건 분기를 추가하여 시각적 정보를 통합.
- **자동 라이깅 파이프라인**: off-the-shelf 이미지-3D 모듈을 활용해 3D 메시에 움직임을 적용.
- **SMAL 기반 재구성**: 3D 움직임 재구성을 위해 SMAL(Skinned Multi-Person Linear) 모델 사용.
주요 결과
- **AiM3D 데이터셋**: 23개 4족 동물 종에 대한 대규모 데이터셋.
- **MDM 모델 성능**: FID 12.3% 개선, R-Precision 7.1% 개선.
- **4D 애니메이션 성능**: 기존 방법 대비 더 높은 시각적 일관성과 효율성.
- **이미지 조건 효과**: Diversity와 Multimodality 점수는 약간 감소했으나, R-Precision, FID, MM-Distance 등 주요 지표에서 상승.
의의 및 한계
Kirin은 동물 움직임 연구의 데이터 부족 문제를 해결하고, 자연스러운 움직임 생성과 3D 애니메이션 자동화를 가능하게 하여 생물 역학, 행동 분석, 캐릭터 애니메이션 분야에 기여한다. 또한, 텍스트-이미지 조건을 결합한 생성 모델은 다양한 응용 분야에서 유용할 수 있다. 그러나 AiM3D는 4족 동물에만 한정되어 있고, 더 다양한 동물 종을 포함하는 확장이 필요하다. 또한, 재구성된 움직임의 정확도는 환경 조건에 따라 변동할 수 있으며, 이는 모델의 일반화 능력을 제한할 수 있다.
실용적 활용
Kirin은 영화, 게임, VR/AR 등에서 자연스러운 동물 애니메이션을 생성하는 데 활용 가능하다. 또한, 생물학 및 생태학 연구에서 동물 행동 분석을 지원할 수 있으며, 교육 콘텐츠 제작에도 적용 가능하다.