한 줄 요약
Rest2Art는 단일 닫힌 상태에서 관절 구조와 3D 기하학을 복원하는 새로운 아티큘레이션 객체 재구성 프레임워크이다.
핵심 기여도
- Rest-state 설정에서 아티큘레이션 객체를 복원하는 새로운 프레임워크 제안 (Rest2Art).
- Vision-Language Model(VLM)과 SAM3를 활용한 반복적 공동 정제 루프 설계.
- 비디오 확산 모델을 사용한 가상 아티큘레이션 시퀀스 생성 및 기하학적 일관성 검증.
- Mesh 기반의 3D 복원으로 기존 재구성 및 생성 기반 베이스라인과 경쟁적인 성능 달성.
핵심 아이디어
기존의 아티큘레이션 객체 재구성 방법은 여러 관절 상태에서 명시적으로 관찰 가능한 움직임을 필요로 하지만, Rest2Art는 단일 닫힌 상태에서 객체를 복원하는 Rest-state 설정을 제안한다. 이는 기하학적, 세미안틱, 운동적 사전 정보가 움직임 없이도 객체의 구조를 추론하는 데 기여한다는 통찰에 기반한다. 핵심 아이디어는 Vision-Language Model(VLM)과 SAM3를 사용하여 부품 계층과 세그멘테이션 마스크를 반복적으로 정제하고, 이들의 불일치를 상호 보완 신호로 활용하는 것이다. 또한, 비디오 확산 모델을 통해 가상의 아티큘레이션 시퀀스를 생성하고, 추출된 2D 궤적을 기반으로 관절 모델을 피팅하며, 기하학적 일관성을 통해 관절 파라미터를 추정한다.
기술적 접근법
- **입력**: 단일 닫힌 상태의 3D 메시 (Mesh).
- **모듈**: VLM, SAM3, 비디오 확산 모델.
- **알고리즘 단계**:
- **하이퍼파라미터**: 명시되지 않음.
- **중간 표현**: 명시적 메시 (Explicit Mesh)를 사용하여 노이즈 있는 예측을 일관된 3D 결과로 통합.
1. VLM과 SAM3를 사용한 반복적 공동 정제 루프 (Section 3.2).
2. 비디오 확산 모델을 사용한 가상 아티큘레이션 시퀀스 생성 및 관절 파라미터 추정 (Section 3.3).
3. 기하학적 일관성을 기반으로 관절 정렬 및 충돌 제약 최소화.
주요 결과
- **Synthetic Data**: Articulate AnyMesh 대비 더 높은 타입 정확도 (Type Accuracy) 달성.
- **Real-World Data (MultiScan)**: Articulate AnyMesh 대비 관절 타입 정확도 +12.3%, 각도 오차 감소.
- **비교 대상**: ArtGS, REArtGS, Articulation in Motion 등 재구성 및 생성 기반 베이스라인과 경쟁적 성능.
- **관절 추정**: 관절 축 정확도 (Axis Estimation)에서 ArtGS 대비 +8.7% 개선.
의의 및 한계
Rest2Art는 움직임 없이도 객체의 관절 구조를 복원하는 기술적 가능성을 입증하며, 디지털 트윈 및 물리 시뮬레이션에 활용 가능한 정량적 3D 복원을 제공한다. 특히, VLM과 세그멘테이션 모델의 노이즈 예측을 메시 기반으로 통합하는 접근은 기존 방법 대비 더 높은 안정성을 보인다. 그러나, 복잡한 운동 구조 (예: 다중 관절, 복합 연결)에 대한 일반화 능력은 아직 한계가 있으며, 비디오 확산 모델의 물리적 타당성 향상이 필요하다.
실용적 활용
Rest2Art는 인터랙티브 시뮬레이션, 공간 계획, 온라인 제품 이미지에서 자동 3D 모델 생성 등에 활용 가능하다. 특히, ScanNet, Replica와 같은 대규모 장면 데이터셋에서 닫힌 상태의 객체를 대상으로 한 디지털 트윈 구축에 유용하다.