한 줄 요약
ATSplat은 적응형 토큰 확장을 통해 3D Gaussian Splatting의 장점을 복원한 실시간 렌더링 성능을 갖는 컴팩트한 피드포워드 프레임워크이다.
핵심 기여도
- ATSplat은 3DGS의 장점을 복원한 **Adaptive 3D Anchor Tokens** 기반 피드포워드 프레임워크를 제안.
- **Adaptive Token Expansion 모듈**을 통해 렌더링 오류 없이도 어려운 영역을 식별하고 선택적으로 확장.
- RealEstate10K와 DL3DV 데이터셋에서 기존 방법 대비 **5.7배 적은 Gaussian 수**로 최고 성능 달성.
- 512×960 해상도에서 1136 FPS의 렌더링 속도와 1초 미만의 재구성 시간을 보여.
핵심 아이디어
기존 피드포워드 3DGS는 입력 이미지 그리드에 Gaussian을 할당하여, 렌더링 효율성과 표현력 사이의 균형을 잃는다. ATSplat은 이 문제를 해결하기 위해 **Adaptive 3D Anchor Tokens**를 도입하여, 입력 이미지 구조가 아닌 **장면 복잡도에 따라 Gaussian 배치를 결정**한다.
ATSplat은 먼저 **패치 단위의 깊이와 카메라 정보를 3D anchor tokens으로 변환**하여 장면의 컴팩트한 구조를 형성한다. 이후, 각 토큰은 **3D 오프셋을 학습하여 로컬 Gaussian으로 디코딩**되며, 입력 그리드와 독립적으로 배치된다.
핵심적인 **Adaptive Token Expansion 모듈**은 렌더링 오류 맵을 기반으로 토큰별 불확실도 점수를 학습하고, 어려운 영역의 토큰을 선택적으로 확장하여 표현력 집중. 이는 3DGS 최적화의 핵심 원리인 **적응형 용량 할당**을 피드포워드 환경에서 복원한다.
기술적 접근법
- **Adaptive 3D Anchor Tokens**: 입력 이미지 패치의 깊이와 카메라 정보를 3D 공간에 투영하여 초기 anchor tokens 생성.
- **3D 오프셋 학습**: 각 anchor token은 3D 오프셋을 학습하여 로컬 Gaussian으로 디코딩.
- **Adaptive Token Expansion 모듈**: 렌더링 오류 맵을 사용해 토큰별 불확실도 점수를 학습하고, 높은 점수를 가진 토큰을 확장.
- **입력 해상도**: 512×960, 입력 이미지 수: 12장.
- **하드웨어**: 단일 RTX 3090 GPU 사용.
주요 결과
- **RealEstate10K** 데이터셋에서 PSNR, SSIM, LPIPS 지표에서 기존 방법 대비 **5.7배 적은 Gaussian 수**로 최고 성능 달성.
- **DL3DV** 데이터셋에서도 유사한 개선 폭 보여.
- 512×960 해상도에서 **1136 FPS**의 렌더링 속도, **311K Gaussian**만으로 높은 품질 렌더링.
- 재구성 시간: **1초 미만** (단일 GPU 기준).
의의 및 한계
ATSplat은 피드포워드 3DGS에서 **3DGS 최적화의 핵심 원리인 적응형 용량 할당**을 복원함으로써, 표현력과 효율성을 동시에 달성한 사례로, 학술적으로 중요한 기여를 한다. 또한, **실시간 렌더링과 낮은 메모리 사용량**은 산업적 활용 가능성을 높인다.
하지만, ATSplat은 **토큰 확장은 하지만 불필요한 토큰은 제거하지 않음**으로써, 효율성 개선의 한계가 존재. 또한, **더 큰 규모의 장면, 더 많은 입력 뷰, 더 높은 해상도**에 대한 확장성도 아직 검증되지 않았다.
실용적 활용
ATSplat은 **실시간 렌더링이 필요한 AR/VR, 콘텐츠 생성, 자율 주행** 등에서 유용하게 활용될 수 있다. 특히, **입력 이미지 수가 제한된 환경**에서 높은 품질의 3D 재구성을 제공하며, **GPU 자원이 제한된 모바일 장치**에서도 적용 가능성이 있다.