한 줄 요약
InfiniSplat은 단일 이미지에서 표면 정렬된 3D 가우시안 표현을 생성하여 대규모 뷰포인트 변화에서도 안정적인 렌더링을 달성한다.
핵심 기여도
- **표면 정렬된 2D 지원 생성**: 기하학적 지도를 기반으로 가우시안 위치를 픽셀 그리드가 아닌 표면 구조에 따라 배치함.
- **쿼리 조건에 따른 암시적 가우시안 디코딩**: DINO 및 CNN 특징을 결합한 디코더를 통해 가우시안 속성을 예측함.
- **교차 데이터셋 평가에서 최고 성능**: ETH3D, ScanNet++, Tanks and Temples 등에서 기존 단일 이미지 기반 베이스라인 대비 PSNR, SSIM, LPIPS 등 주요 지표에서 우수함.
- **RGB-only 및 LiDAR 조건 모델 제공**: InfiniSplat-RGB와 InfiniSplat-LiDAR 두 가지 버전을 제안함.
핵심 아이디어
기존 단일 이미지 기반 3D 가우시안 스플래트팅(3DGS) 방법은 픽셀 정렬된 표현을 사용하여, 뷰포인트 변화가 클 경우 표면 구조가 흐트러지고 기하학적 일관성이 떨어지는 문제가 있었다. InfiniSplat은 이 문제를 해결하기 위해 **표면 정렬된 표현(surface-aligned representation)** 을 도입한다. 이는 두 가지 핵심 조건을 만족해야 한다: (1) 가우시안 지원(support)이 깊이 유도된 표면 구조에 따라 배치되며, (2) 가우시안 속성 예측이 고정된 픽셀 중심에 의존하지 않고, 쿼리 조건에 따라 이루어져야 한다. 이를 통해 인접 가우시안들이 표면 구조에 맞춰 일관된 형태를 유지할 수 있다.
기술적 접근법
- **기하학 지도 샘플링(Geometry-guided Sampling)**: DepthPro를 사용하여 깊이 맵을 생성하고, 이를 바탕으로 3D 표면 영역을 백프로젝션하여 2D 지원을 표면 구조에 따라 배치함.
- **암시적 가우시안 디코딩(Implicit Gaussian Decoding)**: DINO와 CNN 특징을 결합한 MLP를 통해 각 지원 위치에서 가우시안의 위치, 스케일, 회전, 색상, 불투명도를 예측함.
- **이중 분기 인코더(Dual-branch Encoder)**: DINO 분기(세미antics)와 CNN 분기(로컬 텍스처)를 병렬로 사용하여, 서로 보완적인 특징을 추출함.
- **가우시안 수**: 각 이미지당 1,500개의 지원을 샘플링하여 최종 가우시안 집합을 생성함.
- **학습 가능한 모듈**: DINO/CNN 인코더, 특징 융합 모듈, 가우시안 MLP는 학습 가능하며, 기하학적 프라이어는 고정됨.
주요 결과
- **ETH3D, ScanNet++ 등에서 최고 성능**: 기존 단일 이미지 기반 3DGS 베이스라인 대비 PSNR, SSIM, LPIPS 등 주요 지표에서 상승함.
- **대규모 뷰포인트 변화에서도 안정성 유지**: 표면 구조가 흐트러지거나 텍스처가 끊기는 현상이 감소함.
- **Zero-shot 일반화 성능**: Hypersim 합성 데이터셋에서 학습한 모델이 실제 개방 세계(open-world) 데이터셋에서도 뛰어난 성능을 보임.
의의 및 한계
InfiniSplat은 단일 이미지 기반 3DGS에서 픽셀 정렬 표현의 한계를 극복하고, 표면 구조에 기반한 더 안정적인 3D 표현을 가능하게 한다. 특히, 대규모 뷰포인트 변화에서도 일관된 렌더링을 제공하며, AR/VR, 핸드헬드 장치 등 실용적 응용에 적합하다. 그러나, 모델은 여전히 단일 이미지만을 입력으로 사용하므로, 다중 뷰포인트 정보가 있는 경우보다는 정밀도가 낮을 수 있다. 또한, 기하학적 프라이어는 고정되어 있어, 더 정확한 깊이 추정을 위해 외부 센서(LiDAR)가 필요할 수 있다.
실용적 활용
InfiniSplat은 AR/VR 환경에서 실시간 3D 장면 생성, 핸드헬드 장치에서 공간 콘텐츠 표시, 또는 대규모 뷰포인트 변화가 필요한 시뮬레이션 및 게임 개발 등에 활용될 수 있다. 특히, 단일 이미지만으로도 높은 품질의 3D 표현을 생성할 수 있어, 콘텐츠 제작 비용을 절감하는 데 유용하다.