한 줄 요약
Mobile-Agent-v2는 다중 에이전트 협업을 통해 모바일 기기 작업을 효율적으로 수행하는 시스템으로, 단일 에이전트 대비 30% 이상의 작업 완료율 향상을 보인다.
핵심 기여도
- **다중 에이전트 아키텍처 제안**: Planning, Decision, Reflection 세 에이전트로 구성된 Mobile-Agent-v2는 작업 진행, 결정, 오류 수정을 분리하여 처리 효율성을 높임.
- **Memory Unit 설계**: Decision Agent가 작업 진행에 따라 업데이트하며, 초점 콘텐츠를 저장하여 유지함.
- **Reflection Agent 도입**: Decision Agent의 작업 결과를 관찰하고 오류를 수정함으로써 정확도 향상.
- **30% 이상의 작업 완료율 향상**: Mobile-Agent 대비 작업 성공률, 완료율, 결정 정확도, 반성 정확도 등 모든 지표에서 개선.
핵심 아이디어
모바일 기기 작업은 텍스트-이미지가 혼합된 긴 토큰 시퀀스를 처리해야 하므로 단일 에이전트 아키텍처에서 작업 진행 및 초점 콘텐츠 탐색이 어려운 문제가 있다. 이를 해결하기 위해 Mobile-Agent-v2는 작업 계획, 결정, 반성을 각각 담당하는 세 에이전트로 분리한 다중 에이전트 아키텍처를 제안한다. Planning Agent는 과거 작업 기록을 요약해 텍스트 기반 작업 진행을 생성하고, Decision Agent는 이 정보를 바탕으로 작업을 수행하며 초점 콘텐츠를 Memory Unit에 저장한다. Reflection Agent는 작업 결과를 모니터링하여 오류를 감지하고 수정한다. 이는 단일 에이전트가 긴 입력을 처리하는 한계를 극복하고, 작업 흐름을 명확히 유지하는 데 기여한다.
기술적 접근법
- **Planning Agent**: 과거 작업 기록을 요약해 순수 텍스트 형식의 작업 진행(task progress)을 생성.
- **Decision Agent**: 작업 진행을 바탕으로 다음 작업을 결정하며, Memory Unit을 업데이트.
- **Reflection Agent**: 작업 결과를 관찰하고, 예상과 다른 경우 오류를 수정.
- **Memory Unit**: Decision Agent가 작업 진행에 따라 초점 콘텐츠를 저장 및 업데이트.
- **시각 인식 모듈**: OCR(ConvNextViT), 아이콘 인식(GroundingDINO), 아이콘 설명(Qwen-VL-Int4)을 사용.
- **MLLMs**: Planning Agent는 GPT-4, Decision 및 Reflection Agent는 GPT-4V 사용.
- **실험 환경**: Harmony OS와 Android OS, 시스템 앱 5개, 외부 앱 5개, 다중 앱 작업 8개 포함한 88개 지시문 평가.
주요 결과
- **성공률 (SR)**: Mobile-Agent 대비 평균 27% 향상. 특히 고난이도 지시문에서 55% (Mobile-Agent 20%) 달성.
- **완료율 (CR)**: 다중 앱 작업에서 Mobile-Agent 대비 37.5% (SR), 44.2% (CR) 향상.
- **결정 정확도 (DA)**: 단일 앱 작업 대비 다중 앱 작업에서 더 높은 오류 발생, 그러나 Reflection Agent가 이를 보완.
- **반성 정확도 (RA)**: 지식 주입 시 완료율 100% 달성, 결정 정확도는 100% 미달.
- **지식 주입 효과**: 인공 지식 주입 시 성능 향상, 특히 복잡한 작업에서 유의미한 개선.
의의 및 한계
Mobile-Agent-v2는 단일 에이전트 아키텍처의 한계를 극복하고, 작업 흐름과 초점 콘텐츠 유지, 오류 수정을 효과적으로 처리함으로써 모바일 기기 작업 자동화의 신뢰성을 높인다. 특히 Memory Unit과 Reflection Agent의 도입은 작업 일관성과 정확도를 향상시키는 핵심 기술로, 학술적·실용적 가치가 높다. 그러나 GPT-4V에 의존하므로 모델 변경 시 성능 변동이 있을 수 있으며, 모든 작업 상황에서 100% 정확도를 달성하지 못하는 한계가 있다. 또한, 지식 주입이 필요하다는 점은 완전 자동화를 방해할 수 있다.
실용적 활용
Mobile-Agent-v2는 스마트폰 자동화 작업, 앱 테스팅, 사용자 인터페이스 자동화 등 다양한 모바일 기기 관련 산업에 적용 가능하다. 특히, 테스트 스크립트 작성 자동화 및 다국어 환경에서의 작업 수행에 유용하며, 인공 지식 주입을 통해 복잡한 사용자 지시를 처리할 수 있어 모바일 앱 개발 및 QA 분야에서 활용 가능성이 크다.