한 줄 요약
Embodied Agent Interface를 통해 LLM의 몸체화 결정 과제 성능을 체계적으로 평가하고, 핵심 모듈별 오류를 분석하여 활용 방향을 제시한다.
핵심 기여도
- Embodied Agent Interface를 제안하여 LLM 기반 몸체화 에이전트의 핵심 모듈 (goal interpretation, subgoal decomposition, action sequencing, transition modeling)을 통합 평가.
- LTL 기반 목표 명세와 세부 평가 지표 (hallucination, affordance, planning error 등)를 도입하여 성능 분석을 구조화.
- 18개 LLM을 BEHAVIOR와 VirtualHome 시뮬레이터에서 평가, o1-preview, Claude-3.5 Sonnet, Gemini 1.5 Pro가 상위 성능을 보임.
- LLM이 공간 관계 (onfloor, ontop)를 정확히 해석하지 못하는 한계를 밝혀냄.
핵심 아이디어
기존 연구는 LLM을 다양한 방식으로 몸체화 에이전트에 적용했으나, 입력/출력 형식, 평가 기준, 목표 정의가 일관되지 않아 성능 비교가 어려웠다. 이를 해결하기 위해 Embodied Agent Interface를 제안하여, LTL 기반의 목표 명세와 4개 핵심 모듈 (goal interpretation, subgoal decomposition, action sequencing, transition modeling)을 표준화하고, 각 모듈별 오류 유형을 세분화한 평가 체계를 구축했다. 특히, LLM이 자연어 지시를 객체 상태 및 관계로 정확히 해석하지 못하는 문제를 발견했으며, 이는 공간 관계 (예: onfloor, ontop)와 관련된 오류로 나타났다.
기술적 접근법
- **Embodied Agent Interface**: LTL 기반의 목표 명세와 4개 핵심 모듈 (goal interpretation, subgoal decomposition, action sequencing, transition modeling)을 표준화.
- **평가 지표**: hallucination, affordance, planning error 등 세부 오류 유형을 포함한 fine-grained 평가 체계.
- **실험 환경**: BEHAVIOR와 VirtualHome 시뮬레이터에서 18개 LLM 평가.
- **입력 형식**: 객체 중심의 상태 및 행동 표현, 관계 그래프를 기반으로 LLM에 제공.
- **비교 실험**: Llama 3와 LLaVA를 사용한 VLM 대 LLM 비교 실험 (Exp.0~Exp.4).
주요 결과
- **o1-preview**는 BEHAVIOR에서 74.9%의 성능을 기록하며, goal interpretation, action sequencing, transition modeling에서 상위 성능.
- **Claude-3.5 Sonnet**은 goal interpretation (BEHAVIOR)과 transition modeling (VirtualHome)에서 뛰어난 성능.
- **Mistral Large**는 VirtualHome에서 action sequencing에서 1위.
- **Mixtral-8x22B**는 open-weight LLM 중 transition modeling에서 1위.
- **LLaVA**는 end-to-end 방식 (Exp.1)에서 Llama 3 대비 15% 이상 낮은 성능, scene graph 추가 (Exp.2)로 개선됨.
- **공간 관계 오류**: "onfloor(gym_shoe, floor)"와 같은 관계를 LLM이 대부분 누락 (예: "sneakers cleaning" 태스크).
의의 및 한계
Embodied Agent Interface는 LLM 기반 몸체화 에이전트의 핵심 능력을 체계적으로 평가할 수 있는 표준 프레임워크를 제공하며, 각 모듈별 성능과 오류를 분석함으로써 LLM의 활용 방향을 명확히 제시한다. 특히, LLM이 공간 관계와 장기적 행동 순서를 정확히 해석하지 못하는 문제를 밝혀내어, 향후 연구 방향을 제시한다. 그러나 현재 평가는 추상적 언어 표현으로 정의된 상태와 행동에만 국한되며, 시각 입력 (vision)이나 내비게이션, 기억 시스템과 같은 확장이 필요하다는 한계가 있다.
실용적 활용
Embodied Agent Interface는 로봇 제어, 가상 환경 내 자율 에이전트 개발, 서비스 로봇의 지시 수행 등 다양한 산업 및 연구 분야에서 LLM의 선택적 활용을 가능하게 한다. 특히, 공간 관계 해석 능력이 필요한 물리적 환경에서의 태스크 실행에 적합하며, LLM의 장단점을 기반으로 최적의 모듈 조합을 설계할 수 있다.