한 줄 요약
MPIE-Bench는 다인물 상호작용 편집의 해부학적 일관성을 평가하기 위한 2,500개 샘플의 벤치마크와 MPIE-Eval이라는 새로운 평가 프로토콜을 제안한다.
핵심 기여도
- MPIE-Bench: 405개 장면, 14개 상호작용 범주, C0–C3 접촉 밀도로 구성된 2,500개 편집 트리플 벤치마크.
- MPIE-Eval: Multi-HMR을 기반으로 한 해부학적 일관성(Anatomy: 최대 0.65)과 상호작용 일치도(Interaction: 최대 0.72)를 평가하는 2개 새로운 평가 축.
- 5명의 사람 평가자와 비교 실험에서 VLM 체크리스트(0.95 이상)보다 더 인간 판단과 일치함을 확인.
- 모든 가중치와 임계값이 고정되어 있어 재현 가능성을 보장.
핵심 아이디어
기존 텍스트-이미지 생성 모델은 단일 인물 이미지를 잘 생성하지만, 다인물의 신체 접촉 상호작용(예: 포옹, 운반, 격투)을 생성할 때 해부학적 오류(예: 융합된 팔, 가상의 신체 부위, 신체 침투)가 발생한다. 기존 평가 체계는 이러한 오류를 감지하지 못하며, VLM 체크리스트는 인간에게 명확한 오류를 높은 점수로 평가한다. 이를 해결하기 위해 MPIE-Eval은 Multi-HMR이라는 3D 인물 메시 복원 모델을 사용하여 생성 이미지의 해부학적 일관성과 상호작용 일치도를 정량적으로 평가한다. Anatomy는 생성된 모든 인물이 완전한 신체 메시로 재구성되었는지, Interaction은 신체 간 침투와 표면 거리가 요청된 상호작용과 일치하는지 평가한다.
기술적 접근법
- **MPIE-Bench 데이터 구성**: 2,500개 편집 트리플, 405개 장면, 14개 상호작용 범주, C0–C3 접촉 밀도.
- **MPIE-Eval 평가 축**:
- Anatomy: Multi-HMR을 사용한 신체 메시 재구성으로 완전한 신체 유무 평가.
- Interaction: 신체 간 침투와 표면 거리가 요청된 상호작용과 일치하는지 평가.
- **평가 설정**: 10개 편집기(7개 오픈소스, 3개 클로즈드), Multi-HMR은 고정된 공개 모델.
- **점수 계산**: Anatomy 최대 0.65, Interaction 최대 0.72. VLM 체크리스트는 동일 이미지에 대해 0.95 이상 평가.
주요 결과
- **MPIE-Eval 평가 결과**: Anatomy 최대 0.65, Interaction 최대 0.72.
- **VLM 체크리스트 vs. MPIE-Eval**: VLM 체크리스트는 동일 이미지에 대해 0.95 이상 평가하지만, MPIE-Eval은 인간 평가자와 더 높은 일치도를 보임.
- **5명의 사람 평가자 실험**: MPIE-Eval의 Anatomy와 Interaction 축이 인간 판단과 더 밀접하게 일치함을 확인.
- **가중치/임계값 제거 실험**: 모든 가중치와 임계값을 제거해도 순위 유지됨.
의의 및 한계
MPIE-Bench와 MPIE-Eval은 기존 평가 체계가 감지하지 못하는 해부학적 오류를 정량적으로 평가할 수 있는 새로운 프레임워크를 제시한다. 특히, Multi-HMR을 기반으로 한 메시 재구성은 인간 판단과 높은 일치도를 보이며, 모델 간 비교의 신뢰성을 높인다. 그러나 MPIE-Eval은 Multi-HMR의 재구성 능력에 의존하므로, 메시 복원이 불완전한 경우 평가 정확도가 떨어질 수 있다. 또한, 현재는 10개 편집기만 평가했으며, 더 많은 모델과 데이터셋에서 검증이 필요하다.
실용적 활용
MPIE-Bench와 MPIE-Eval은 인공지능 기반의 다인물 생성 모델의 신뢰성과 안정성을 평가하는 데 활용될 수 있다. 특히, 인터랙티브 콘텐츠 제작, 게임 개발, VR/AR 등에서 신체 접촉을 포함한 인물 생성의 해부학적 일관성을 보장하는 데 유용하다.