한 줄 요약
Motion-Omni는 대화 중 말과 동작을 동시에 생성하는 엔드투엔드 프레임워크로, 말과 몸짓을 동일한 상태에서 생성하여 실시간 성능과 정확도를 동시에 향상시킨다.
핵심 기여도
- 말과 몸짓을 동시에 생성하는 엔드투엔드 프레임워크 Motion-Omni를 제안.
- 422,856개의 품질 순위가 매겨진 말-동작 쌍 데이터셋을 생성 (1,402시간).
- SwDA-500 평가 프로토콜을 공개, 말-동작 일관성, 인간 평가, 렌더링, 지연 측정을 통합.
- Motion-Omni-Q7 모델은 동일 음성 기반의 teacher cascade와 2% 이내의 motion metric 차이를 보이며 5.4× 빠른 응답 속도(RTF=0.78)를 달성.
핵심 아이디어
기존 대화 모델은 말을 생성하고 별도의 모델이 동작을 생성하는 방식으로, 이는 두 번의 추론 과정을 필요로 하며 최적화가 불가능하다. Motion-Omni는 대화 모델이 말과 몸짓을 동시에 생성하도록 설계하여, 동일한 hidden state에서 speech와 motion을 생성함으로써 일관성을 유지한다. 핵심 아이디어는 Speech Generator의 hidden state를 Motion Generator가 직접 참조하는 방식으로, 이는 말의 톤과 리듬을 반영한 자연스러운 몸짓 생성을 가능하게 한다. 이는 말과 몸짓 간의 rate mismatch(12.5Hz vs 30Hz)를 해결하기 위해 dual-input conditioning interface를 도입한 것이다.
기술적 접근법
Motion-Omni는 4개의 주요 모듈로 구성된다:
- **Speech Projector**: LLM의 출력을 speech token으로 변환.
- **LLM Backbone**: Qwen2.5-7B-Instruct 기반, 대화 응답을 생성.
- **Speech Generator**: Qwen2.5-0.5B-Instruct 기반, speech unit 생성.
- **Part-Aware Motion Generator**: 4개의 part-specific decoder(얼굴, 손, 상체, 하체)로 구성, motion을 생성.
모델은 4단계 학습 과정을 거침: ASR, TTS, TTS-with-Motion, joint mixture. 이 과정에서 Speech Generator와 Motion Generator가 공유된 hidden state를 기반으로 joint optimization을 수행. Motion Generator는 Speech Generator의 key/value와 query(발화 토큰)를 결합하여 motion을 생성. 이는 waveforms를 사용하지 않고 speech representation을 직접 활용하는 방식이다.
주요 결과
- Motion-Omni-Q7은 teacher cascade와 비교해 reference-free motion metric에서 2% 이내의 차이를 보이며, 5.4× 빠른 응답 속도(RTF=0.78)를 달성.
- SwDA-500 평가에서 beat correlation과 diversity에서 non-teacher cascade 모델을 상회.
- Word error rate는 2.62%로, 비교된 omni-modal 시스템 중 가장 낮음.
- 렌더링된 동영상의 입술 동기화도 EMAGE 및 MambaTalk cascade 모델보다 우수.
의의 및 한계
Motion-Omni는 말과 몸짓을 동시에 생성하는 첫 엔드투엔드 모델로, 대화 모델의 표현력과 자연스러움을 동시에 향상시킨다. 특히, 말과 몸짓 간의 일관성을 유지하면서도 실시간 성능을 달성한 점이 학술적·실용적 가치를 높인다. 그러나 모델의 전체 파라미터 수는 약 8.3B로, 대규모 계산 자원이 필요하다는 한계가 있다. 또한, teacher pseudo-labeling을 통해 생성된 데이터는 teacher 모델의 품질에 의존하며, 이는 모델의 일반화 능력에 영향을 줄 수 있다.
실용적 활용
Motion-Omni는 가상 인간, 챗봇, 게임 캐릭터 등 대화형 인터페이스에 적용 가능하다. 특히, 대화 중 자연스러운 몸짓을 생성해 사용자 경험을 향상시키는 데 유용하며, 실시간 대화 시스템에서 빠른 응답 속도와 정확도를 동시에 요구하는 상황에 적합하다.