한 줄 요약
손 관절별 가시성 추정을 위한 독립적 모델인 Hand Visibility Detector를 제안하고, 3D 손 포즈 추정에서 재투영 오류 감소를 실증적으로 보인다.
핵심 기여도
- 관절별 가시성 추정을 독립적 과제로 정의하고, Hand Visibility Detector를 제안.
- HInt 데이터셋에서 기존 방법 대비 3.4 mAP 포인트 개선.
- 가시성 가중치를 적용한 3D 손 포즈 추정에서 DexYCB, HO3D, H2O 데이터셋에서 최대 10.1%의 재투영 오류 감소.
- ViT 기반 사전 학습된 HPE 모델의 사전 지식 활용을 통해 높은 성능 달성.
핵심 아이디어
기존 HPE 모델은 관절 위치만 출력하며, 가시성은 보조 신호로 사용되었다. 본 연구는 관절별 가시성 자체를 독립적 추정 대상으로 정의하고, 이를 위해 가시성 헤드(visibility head)를 사전 학습된 HPE 모델(ViT)에 붙인 간단한 구조를 제안한다. 이는 사전 학습된 모델이 이미 학습한 대규모 데이터의 사전 지식을 활용하여, 가시성 추정 성능을 향상시키는 핵심 아이디어이다. 또한, 가시성 정보를 3D 포즈 추정에 활용함으로써 재투영 오류를 감소시킬 수 있음을 보인다.
기술적 접근법
- **모델 구조**: 사전 학습된 ViT 기반 HPE 모델의 frozen backbone에 lightweight visibility head를 추가.
- **입력 처리**: ground-truth bounding box를 1.25배 확장 후 256×256 크기로 리사이징, 256×192 크기로 자름.
- **가시성 헤드**: hidden dimension 256, dropout rate 0.1, 0.83M 파라미터 (전체 모델의 0.131%).
- **학습 설정**: AdamW, learning rate 1.0×10⁻³, batch size 256, 100 epoch.
- **데이터셋**: HInt (25,273 training, 5,374 evaluation), MANO 21 관절 기반.
주요 결과
- **HInt 데이터셋**: 기존 방법 대비 3.4 mAP 포인트 개선.
- **3D 손 포즈 추정**: DexYCB, HO3D, H2O 데이터셋에서 visibility-weighted triangulation으로 재투영 오류 감소 (최대 10.1%).
- **성능 비교**: ResNet-50 및 CSPNeXt 기반 baseline 대비 ViT 기반 모델이 우수한 성능 보임.
의의 및 한계
- **의의**: 관절별 가시성 추정을 독립적 과제로 정의하고, 이를 위한 첫 번째 모델을 제안. 3D 포즈 추정에서의 실용적 활용성을 입증.
- **한계**: 현재는 단일 이미지 기반으로, 동영상 입력을 고려한 시간적 일관성(time consistency)은 아직 연구되지 않음. 또한, HInt 데이터셋의 특정 도메인에 의존할 수 있음.
실용적 활용
AR/VR, 로봇, 인간-컴퓨터 상호작용 등에서 손 포즈 추정의 신뢰도를 평가하는 데 활용 가능. 특히, 다중 뷰 3D 포즈 자동 라벨링에서 재투영 오류 감소를 통해 라벨링 정확도를 향상시킬 수 있다.