한 줄 요약
Scal3R은 KITTI 데이터셋에서 평균 ATE를 60% 이상 개선하며, 1% 미만의 파라미터로 온라인 3D 재구성을 안정적으로 수행하는 다중 참조 상대 자세 쿼리 프레임워크이다.
핵심 기여도
- 기존 전방향 전역 자세 회귀의 불안정성을 분석하고, 로컬 기하학이 안정적임을 밝힘.
- Scal3R은 학습 가능한 토큰(약 1% 파라미터)을 사용해 동결된 백본에 비대칭 어텐션을 주입함.
- 다중 참조 상대 자세 쿼리와 온라인 PGO를 통합하여 KITTI에서 평균 ATE를 60% 이상 감소.
- 8시간, 단일 GPU로 수렴하며, Virtual KITTI, Sintel, ScanNet 등에서 최첨단 성능 달성.
핵심 아이디어
기존 온라인 3D 재구성 모델은 첫 번째 프레임을 기준으로 전역 자세를 회귀하는 방식을 사용하지만, 이는 긴 영상에서 예측 분포를 벗어나게 되어 누적 드리프트와 기하학적 붕괴를 유발한다. Scal3R은 이 문제를 해결하기 위해 전역 자세 회귀를 다중 참조 상대 자세 쿼리로 재구성한다. 각 프레임의 로컬 기하학은 안정적이기 때문에, 이 정보를 활용해 과거 키프레임에 대한 상대 자세를 추정하는 방식을 채택한다.
이를 위해 Scal3R은 동결된 백본에 약 1%의 파라미터를 차지하는 가벼운 학습 가능한 토큰을 주입하고, 비대칭 어텐션을 통해 이미지 특징을 쿼리한다. 이는 백본의 기하학적 표현력을 유지하면서도, 자세 추정 과정에서 로컬 영역에 집중하도록 유도한다. 또한, 온라인 PGO와 루프 클로저를 결합하여 전역 일관성을 유지한다.
기술적 접근법
- **모델 구성**: CUT3R 및 STream3R의 24층 Transformer 백본을 사용하며, DINOv2 인코더와 Transformer 디코더로 구성됨.
- **토큰 주입**: 각 프레임에 대해 학습 가능한 상대 자세 쿼리 토큰(약 1% 파라미터)을 디코더에 비대칭 어텐션을 통해 주입.
- **자세 추정**: 토큰은 과거 키프레임과의 상대 변환(6D 회전 및 이동 벡터)을 예측.
- **온라인 최적화**: 상대 자세는 PGO를 통해 전역 트래젝토리로 집계되며, 루프 클로저가 자연스럽게 통합됨.
- **학습 전략**: 다중 참조 훈련을 통해 RPE trans 3.336에서 ATE 5.632로 개선됨.
주요 결과
- **KITTI**: Scal3R은 온라인 기준 대비 평균 ATE를 60% 이상 감소.
- **Virtual KITTI, Sintel, TUM-Dynamic, ScanNet, 7-Scenes**: 최첨단 성능 달성.
- **수렴 속도**: 단일 GPU에서 8시간만에 수렴.
- **토큰 비중**: 전체 파라미터의 약 1%만 사용.
의의 및 한계
Scal3R은 기존 온라인 3D 재구성 모델의 전역 자세 회귀 방식의 한계를 극복하며, 긴 영상에서도 안정적인 재구성을 가능하게 한다. 특히, 동결된 백본과 가벼운 토큰을 활용한 비대칭 어텐션은 모델의 기하학적 표현력을 유지하면서도 학습 비용을 줄이는 데 기여한다.
그러나, Scal3R은 훈련 데이터가 제한된 환경에서의 일반화 능력을 명시하지 않았으며, 루프 클로저의 성능이 외부 영상 스트림의 복잡성에 따라 변동할 수 있다는 한계가 있다.
실용적 활용
Scal3R은 자율주행, 드론 네비게이션, AR/VR 등에서 실시간 3D 재구성을 필요로 하는 산업에 적용 가능하다. 특히, 긴 영상에서도 드리프트를 억제하는 특성으로, 대규모 환경의 지속적인 모니터링 및 매핑에 유용하다.