Structured 3D Latents for Scalable and Versatile 3D Generation

Jianfeng Xiang, Zelong Lv, Sicheng Xu, Yu Deng, Ruicheng Wang, Bowen Zhang, Dong Chen, Xin Tong, Jiaolong Yang

arXiv:2412.01506 · 2026-07-27 공개 · arXiv · PDF

rectified-flow large-scale-training vision-foundation-model radiance-fields structured-latents multiview-features high-quality-3d

Abstract

We introduce a novel 3D generation method for versatile and high-quality 3D asset creation. The cornerstone is a unified Structured LATent (SLat) representation which allows decoding to different output formats, such as Radiance Fields, 3D Gaussians, and meshes. This is achieved by integrating a sparsely-populated 3D grid with dense multiview visual features extracted from a powerful vision foundation model, comprehensively capturing both structural (geometry) and textural (appearance) information while maintaining flexibility during decoding.We employ rectified flow transformers tailored for SLat as our 3D generation models and train models with up to 2 billion parameters on a large 3D asset dataset of 500K diverse objects. Our model generates high-quality results with text or image conditions, significantly surpassing existing methods, including recent ones at similar scales. We showcase flexible output format selection and local 3D editing capabilities which were not offered by previous models. Project Page: trellis3d.github.io.

한국어 요약

한 줄 요약

SLat 기반 3D 생성 모델 Trellis는 500K 개의 3D 자산으로 학습되어 높은 품질의 3D 생성과 편집을 지원한다.

핵심 기여도

핵심 아이디어

기존 3D 생성 모델은 다양한 표현 방식(메시, 라디언스 필드, 3D 가우시안 등)에 따라 별도의 모델이 필요했으며, 이로 인해 유연성과 일관성에 한계가 있었다. 본 연구는 SLat이라는 통합 잠재 표현을 도입하여 이러한 문제를 해결한다. SLat은 희소 3D 그리드에 기반한 구조와, 강력한 비전 기초 모델에서 추출한 다중 뷰 시각 특성을 결합하여, 기하학적 구조와 텍스처 정보를 모두 포괄적으로 인코딩한다. 이는 디코딩 시 다양한 3D 표현 방식으로 유연하게 변환할 수 있도록 한다.

또한, SLat은 로컬 편집이 가능하도록 설계되어, 텍스트 또는 이미지 조건 하에 특정 지역을 삭제, 추가, 대체하는 편집 기능을 제공한다. 이는 기존 3D 생성 모델에서는 제공되지 않았던 기능이다.

기술적 접근법

주요 결과

의의 및 한계

SLat은 다양한 3D 표현 방식을 통합한 유연한 잠재 표현으로, 3D 생성 분야에서 새로운 기준을 제시한다. 기존 연구는 특정 표현 방식에 의존적이었으나, SLat은 이러한 제약을 줄이고 다양한 출력 포맷을 지원함으로써 3D 생성의 범용성을 높인다. 또한, 3D 피팅 없이 훈련 가능하다는 점에서 실용적 가치가 높다.

한편, 20억 파라미터 규모의 모델은 계산 자원이 상당히 필요하며, 실시간 또는 자원 제약이 있는 환경에서는 한계가 있을 수 있다. 또한, 특정 조건에서 생성 품질이 저하될 가능성도 존재하며, 이에 대한 추가 연구가 필요하다.

실용적 활용

Trellis는 디지털 콘텐츠 제작, 게임 개발, 가상 현실(VR) 및 증강현실(AR) 등 다양한 산업에서 높은 품질의 3D 자산 생성과 편집을 지원할 수 있다. 특히, 텍스트 또는 이미지 조건으로 즉시 3D 모델을 생성할 수 있어, 디자인 및 프로토타이핑 과정을 효율화할 수 있다.