한 줄 요약
Magma는 UI 탐색과 로봇 조작 등 다양한 환경에서 작동하는 멀티모달 에이전트 기반 모델로, SoM과 ToM을 통해 공간-시간적 지능을 획기적으로 향상시킨다.
핵심 기여도
- Magma는 UI 및 로봇 데이터를 포함한 3900만 개의 이질적 데이터셋을 사용하여 훈련된 첫 번째 멀티모달 에이전트 기반 기반 모델이다.
- Set-of-Mark (SoM)와 Trace-of-Mark (ToM)라는 두 가지 새로운 훈련 태스크를 제안하여, 행동 정착과 계획을 효과적으로 학습한다.
- Magma는 UI 탐색과 로봇 조작에서 기존 도메인별 모델을 초과하는 최신 기록(SOTA)을 달성한다.
- 단일 파라미터 세트로 훈련된 Magma는 BLINK 데이터셋에서 지시 학습 없이도 최고 성능을 보인다.
핵심 아이디어
Magma는 기존의 Vision-Language (VL) 모델을 확장하여, 단순히 언어-시각 이해(언어 지능)뿐만 아니라, 시각-공간 세계에서 행동을 계획하고 실행하는 능력(공간-시간 지능)을 추가한 멀티모달 에이전트 기반 모델이다. 기존 VLA 모델은 2D 디지털 환경과 3D 물리적 환경을 별도로 훈련하여 일반화 능력이 제한적이었으나, Magma는 단일 모델로 다양한 환경에서 작동할 수 있도록 설계되었다. 이는 SoM과 ToM이라는 두 가지 새로운 훈련 태스크를 통해 달성된다. SoM은 이미지 내 클릭 가능한 버튼 등 행동 가능한 객체를 라벨링하여 행동 정착을 학습하고, ToM은 영상 내 인간 손이나 로봇 팔의 이동 경로를 라벨링하여 행동 계획을 학습한다. 이 두 태스크는 모델이 다양한 환경에서 행동을 추론하고 실행할 수 있도록 도와준다.
기술적 접근법
- **Set-of-Mark (SoM)**: 이미지 내 행동 가능한 객체(예: GUI 클릭 가능한 버튼)를 라벨링하여 행동 정착을 학습.
- **Trace-of-Mark (ToM)**: 영상 내 객체 이동(예: 인간 손 또는 로봇 팔의 이동 경로)을 라벨링하여 행동 계획을 학습.
- **이질적 데이터셋**: UI 데이터(예: SeekClick), 로봇 조작 데이터(예: OXE), 인간 지시 영상(예: Ego-4D), 이미지-텍스트 쌍(예: LMMs) 등을 포함한 3900만 개의 샘플로 훈련.
- **단일 파라미터 세트**: 다양한 환경에서 제로샷 방식으로 적용 가능하도록 단일 모델로 훈련.
주요 결과
- **UI 탐색**: Magma는 Mind2Web, AITW 데이터셋에서 기존 도메인별 모델을 초과하는 최신 기록(SOTA)을 달성.
- **로봇 조작**: Bridge, LIBERO 데이터셋에서 기존 모델을 초과하는 성능을 보임.
- **멀티모달 이해**: GQA, VideoMME 데이터셋에서 최신 LMM과 유사한 성능 유지.
- **BLINK 데이터셋**: 지시 학습 없이도 최고 성능 달성.
- **비교 성능**: 기존 VLA 모델 대비 +10% 이상의 개선 폭 보임.
의의 및 한계
Magma는 디지털과 물리적 환경에서 모두 작동하는 멀티모달 에이전트 기반 모델로서, 기존 VLA 모델이 도메인별로 분리되어 훈련되는 한계를 극복한다. 특히, SoM과 ToM을 통해 공간-시간적 지능을 획기적으로 향상시켜, 다양한 환경에서 행동을 추론하고 실행할 수 있는 능력을 갖춘다. 그러나, Magma는 여전히 특정 도메인에서 특화된 모델과 비교했을 때 일부 세부 작업에서 제한이 있을 수 있다. 또한, 훈련 데이터의 질과 라벨링 정확도가 모델 성능에 큰 영향을 미친다는 점도 한계로 지적된다.
실용적 활용
Magma는 UI 자동화, 로봇 조작, 스마트 홈 시스템 등 다양한 산업 분야에서 활용 가능하다. 특히, 단일 모델로 다양한 환경에서 작동할 수 있어, 개발 비용과 시간을 절감할 수 있는 실용적 가치가 있다. 연구 분야에서는 멀티모달 에이전트 기반 모델의 기초 연구와, 공간-시간적 지능의 발전에 기여할 수 있다.