한 줄 요약
LeapTalk은 단일 단계로 200 FPS의 실시간 토킹헤드 생성을 가능하게 하며, 지나치게 많은 단계를 요구하는 확산 모델과 오류 누적 문제를 해결한다.
핵심 기여도
- **단일 단계 추론**을 통해 최대 200 FPS의 실시간 토킹헤드 생성 가능.
- **Brownian Bridge 기반 데이터-데이터 전송**을 도입하여 오류 누적과 ID 드리프트 감소.
- **SNR-정렬 시간 변환 Φ(τ)**와 **오디오-구동 CFG**를 통해 이질적 DMD 프레임워크 구현.
- **HDTF와 CelebV-HQ 데이터셋**에서 FID 21, FVD 197, Sync-C 8.38 등 뛰어난 성능 달성.
핵심 아이디어
기존 토킹헤드 생성 방식은 확산 모델의 높은 지연 또는 자동회귀 모델의 오류 누적 문제로 인해 실시간 및 장시간 생성이 어려웠다. LeapTalk은 이 문제를 해결하기 위해 **Brownian Bridge 기반의 데이터-데이터 전송**을 도입하여, **단일 단계로 생성**하면서도 ID 일관성을 유지한다. 이는 기존의 노이즈-데이터 패러다임을 벗어나, **고정된 참조 이미지 ℐ**를 기반으로 생성 경로를 안정화하여 오류 누적을 방지한다. 또한, **이질적 DMD**를 통해 확산 모델과 브리지 모델 간의 지식 전달을 가능하게 하며, **SNR-정렬 시간 변환 Φ(τ)**를 통해 신호-노이즈 비율을 정렬하여 점수 매칭을 안정화한다. 마지막으로, **오디오-구동 CFG**를 통해 단일 단계에서도 입동기와 얼굴 움직임의 세부 정보를 유지한다.
기술적 접근법
- **Bridge Forcing**: Brownian Bridge 기반의 데이터-데이터 전송을 통해 오류 누적과 ID 드리프트 감소.
- **이질적 DMD**: 확산 모델(교사)과 브리지 모델(학생) 간 지식 전달을 위한 SNR-정렬 시간 변환 Φ(τ) 사용.
- **오디오-구동 CFG**: 단일 단계에서도 입동기와 얼굴 움직임의 정확도 유지.
- **학습 세부사항**: 생성기 학습률 1×10⁻⁴, 가짜 점수 네트워크 학습률 2×10⁻⁶, 배치 크기 1, NVIDIA H200 GPU 사용.
- **데이터셋**: VividHead Dataset, HDTF, CelebV-HQ.
주요 결과
- **HDTF 데이터셋**에서 LeapTalk Pro는 FID 21, FVD 197, Sync-C 8.38 달성.
- **CelebV-HQ 데이터셋**에서 FID 42, FVD 370, Sync-C 8.38 달성.
- **LeapTalk Lite**는 최대 200 FPS 성능, 기존 4단계 모델인 SoulX-FlashHead보다 훨씬 높은 성능 유지.
- **DINOv2 유사도 추적**에서 기존 모델 대비 ID 일관성 유지.
- **Bridge Forcing 제거 시 FID 21 → 217, Sync-C 8.38 → 7.16**으로 급격히 저하됨.
의의 및 한계
LeapTalk은 실시간, 장시간 토킹헤드 생성의 새로운 기준을 제시하며, **단일 단계로 200 FPS**를 달성함으로써 기존 확산 모델과 자동회귀 모델의 한계를 극복한다. 특히, **Brownian Bridge 기반의 데이터-데이터 전송**은 오류 누적 문제를 근본적으로 해결하며, **이질적 DMD**는 이전에 어려웠던 확산 모델과 브리지 모델 간의 지식 전달을 가능하게 한다. 그러나, **단일 단계로 생성한다는 점에서 복잡한 장면 처리 능력이 제한될 수 있으며**, **더 다양한 동작 패턴을 학습하기 위한 데이터 확장이 필요**하다는 한계가 있다.
실용적 활용
LeapTalk은 **디지털 인간, 가상 보조, 콘텐츠 제작** 등 실시간 영상 생성이 필요한 산업에 적용 가능하다. 특히, **고품질 입동기와 얼굴 움직임을 유지하면서도 빠른 속도로 생성**할 수 있어, **라이브 스트리밍, 게임 캐릭터 생성, VR/AR 환경** 등에서 활용도가 높다.