한 줄 요약
SLat 기반 3D 생성 모델 Trellis는 500K 개의 3D 자산으로 학습되어 높은 품질의 3D 생성과 편집을 지원한다.
핵심 기여도
- SLat: 3D 생성을 위한 통합된 구조화된 잠재 표현으로, 라디언스 필드, 3D 가우시안, 메시 등 다양한 출력 포맷으로 디코딩 가능.
- 20억 파라미터 규모의 Trellis 모델: 500K 개의 3D 자산 데이터셋에서 훈련.
- 텍스트 또는 이미지 조건으로 생성 가능하며, 기존 방법 대비 품질 향상.
- 로컬 3D 편집 기능 제공: 기존 모델에서는 제공되지 않았던 기능.
핵심 아이디어
기존 3D 생성 모델은 다양한 표현 방식(메시, 라디언스 필드, 3D 가우시안 등)에 따라 별도의 모델이 필요했으며, 이로 인해 유연성과 일관성에 한계가 있었다. 본 연구는 SLat이라는 통합 잠재 표현을 도입하여 이러한 문제를 해결한다. SLat은 희소 3D 그리드에 기반한 구조와, 강력한 비전 기초 모델에서 추출한 다중 뷰 시각 특성을 결합하여, 기하학적 구조와 텍스처 정보를 모두 포괄적으로 인코딩한다. 이는 디코딩 시 다양한 3D 표현 방식으로 유연하게 변환할 수 있도록 한다.
또한, SLat은 로컬 편집이 가능하도록 설계되어, 텍스트 또는 이미지 조건 하에 특정 지역을 삭제, 추가, 대체하는 편집 기능을 제공한다. 이는 기존 3D 생성 모델에서는 제공되지 않았던 기능이다.
기술적 접근법
- **SLat**: 희소 3D 그리드와 강력한 비전 기초 모델에서 추출한 다중 뷰 시각 특성을 결합한 구조화된 잠재 표현.
- **Trellis 모델**: 20억 파라미터 규모의 3D 생성 모델.
- **Rectified Flow Transformers**: SLat 생성을 위한 백본 모델로, 희소 구조를 처리하도록 적응.
- **2단계 파이프라인**: 첫 번째 단계에서 SLat의 희소 구조를 생성하고, 두 번째 단계에서 비어 있지 않은 셀의 잠재 벡터를 생성.
- **데이터셋**: 500K 개의 다양한 3D 자산으로 훈련.
- **조건 입력**: 텍스트 또는 이미지 조건을 기반으로 생성.
주요 결과
- **텍스트/이미지 조건 생성**: 기존 방법 대비 높은 품질의 3D 자산 생성.
- **다양한 출력 포맷**: 라디언스 필드, 3D 가우시안, 메시 등 다양한 포맷으로 생성 가능.
- **로컬 편집 기능**: 기존 모델에서는 제공되지 않았던 기능.
- **성능 향상**: 500K 개의 3D 자산 데이터셋에서 훈련한 Trellis 모델은 기존 방법 대비 생성 품질이 향상됨. 구체적인 수치는 명시되지 않지만, "significantly surpassing existing methods"로 명시됨.
의의 및 한계
SLat은 다양한 3D 표현 방식을 통합한 유연한 잠재 표현으로, 3D 생성 분야에서 새로운 기준을 제시한다. 기존 연구는 특정 표현 방식에 의존적이었으나, SLat은 이러한 제약을 줄이고 다양한 출력 포맷을 지원함으로써 3D 생성의 범용성을 높인다. 또한, 3D 피팅 없이 훈련 가능하다는 점에서 실용적 가치가 높다.
한편, 20억 파라미터 규모의 모델은 계산 자원이 상당히 필요하며, 실시간 또는 자원 제약이 있는 환경에서는 한계가 있을 수 있다. 또한, 특정 조건에서 생성 품질이 저하될 가능성도 존재하며, 이에 대한 추가 연구가 필요하다.
실용적 활용
Trellis는 디지털 콘텐츠 제작, 게임 개발, 가상 현실(VR) 및 증강현실(AR) 등 다양한 산업에서 높은 품질의 3D 자산 생성과 편집을 지원할 수 있다. 특히, 텍스트 또는 이미지 조건으로 즉시 3D 모델을 생성할 수 있어, 디자인 및 프로토타이핑 과정을 효율화할 수 있다.