한 줄 요약
ManiGaussian은 다중 작업 로봇 조작에서 장면 수준 시공간 역학을 학습하는 동적 가우시안 스플래팅 프레임워크를 제안한다.
핵심 기여도
- **ManiGaussian**이라는 동적 가우시안 스플래팅 프레임워크를 제안하여, 조작 장면의 시공간 역학을 학습한다.
- **가우시안 월드 모델**(Gaussian World Model)을 구축하여, 현재 장면과 로봇 동작을 기반으로 미래 장면을 재구성하며 유의미한 감독 정보를 생성한다.
- RLBench 데이터셋에서 10개 작업, 166개 변형에 대해 평균 성공률 13.1% 개선하며 기존 최고 성능을 초과한다.
- **GNFactor** 대비 1.18× 성능 향상, 2.29× 빠른 학습 속도를 달성한다.
핵심 아이디어
기존 로봇 조작 방법은 주로 시각 정보에서 의미적 표현을 추출하여 동작을 예측하는 방식을 사용하지만, 이는 장면 수준의 시공간 역학을 무시한다. ManiGaussian은 **가우시안 스플래팅**(Gaussian Splatting) 기반의 프레임워크를 통해 장면 내 의미의 전파를 추적하고, 이를 기반으로 최적의 로봇 동작을 예측한다. 특히, **가우시안 임베딩 공간**(Gaussian embedding space) 내에서 의미적 특징의 전파를 모델링함으로써, 물체 간 상호작용을 정확히 이해할 수 있도록 한다.
또한, **가우시안 월드 모델**을 통해 미래 장면을 재구성하며, 재구성된 장면과 실제 장면 간 일관성을 강제함으로써 역학 정보를 학습한다. 이는 **미래 장면 일관성 손실**(future scene consistency loss)을 통해 구현되며, 장기적 조작 과제에서도 효과적이다.
기술적 접근법
- **동적 가우시안 스플래팅 프레임워크**를 제안하여, 의미적 특징의 전파를 추적하고, 이를 기반으로 로봇 동작을 예측한다.
- **가우시안 월드 모델**을 구축하여, 현재 장면과 로봇 동작을 기반으로 미래 장면을 재구성하며, **미래 장면 일관성 손실**을 통해 역학 정보를 학습한다.
- **RGB-D 이미지**(128×128 해상도)를 단일 전면 카메라로 입력받고, **20개 카메라**를 사용해 다각도 감독 정보를 제공한다.
- **PerceiverIO**를 동작 디코더로 사용하며, **LAMB 최적화기**와 **코사인 스케줄러**를 적용하여 학습 효율성을 높인다.
- **SE(3) 증강**을 전문가 시연에 적용하여 일반화 능력을 향상시킨다.
주요 결과
- **RLBench 데이터셋**에서 10개 작업, 166개 변형에 대해 평균 성공률 13.1% 개선 (기존 최고 성능 대비).
- **GNFactor** 대비 1.18× 성능 향상, 2.29× 빠른 학습 속도를 달성.
- **가우시안 회귀기**(Gaussian Regressor)를 추가하면 성능이 15.6% 향상.
- **미래 장면 일관성 손실**을 도입하면 4.4% 추가 성능 향상.
- **기하학적 추론이 필요한 작업**(Occlusion, Tools, Screw)에서 기존 기반 모델 대비 큰 폭의 성능 향상.
의의 및 한계
ManiGaussian은 **장면 수준 시공간 역학**을 학습함으로써, 언어 조건이 있는 로봇 조작 작업에서 높은 성공률을 달성한다. 특히, **가우시안 스플래팅 기반의 명시적 장면 재구성**이 **NeRF와 같은 암시적 방법**보다 효율적임을 보여준다. 이는 로봇이 물체 간 상호작용을 이해하고, 복잡한 작업을 수행하는 데 기여한다.
그러나, **가우시안 스플래팅 프레임워크는 다중 카메라 감독과 칼리브레이션**이 필요하다는 한계가 있다. 이는 실제 환경 적용 시 추가적인 장비와 설정이 요구될 수 있음을 의미한다.
실용적 활용
ManiGaussian은 언어 조건이 있는 **다중 작업 로봇 조작**(예: 물체 정렬, 도구 사용, 복잡한 조립)에 적용 가능하다. 특히, **구조화되지 않은 환경**(예: 가정, 제조 현장)에서 물체 간 상호작용을 이해하는 데 유용하며, **로봇 자율성 향상**에 기여할 수 있다.