한 줄 요약
SeerGuard는 모바일 GUI 에이전트의 안전성을 향상시키기 위해 실행 전 예측 기반의 지시 및 행동 수준 위험 평가를 결합한 안전 프레임워크이다.
핵심 기여도
- SeerGuard는 지시 수준 스크리닝과 행동 수준 위험 평가를 결합한 **의사결정 전 예측 기반 안전 프레임워크**를 제안함.
- **SAWM**(Safety-Augmented World Model)을 통해 **다중 작업 학습**(multi-task learning)으로 **의도 분석**과 **다음 상태 예측**을 통합함.
- Qwen3-VL-8B-Instruct에서 **Safety-Utility Score**를 0.191 → 0.596, **Risk-Cost Score**를 0.347 → 0.130로 개선함.
- **고위험 행동 거부율**을 6개 태스크 카테고리에서 높임.
핵심 아이디어
기존 모바일 GUI 에이전트의 안전 메커니즘은 주로 **실행 후**(post-hoc) 위험 평가에 의존하거나, **지시 수준**(instruction-level)에서만 위험을 탐지하는 데 제한적이었다. SeerGuard는 **실행 전**(pre-execution)에 **행동**(action)의 결과를 예측하여 위험을 판단하는 **의사결정 전**(pre-decision) 안전 프레임워크를 제안한다. 이는 모바일 환경에서 **하나의 잘못된 터치가 즉각적이고 되돌릴 수 없는 결과**를 초래할 수 있는 상황에서 특히 중요하다. 핵심 아이디어는 **세마틱**(semantic) 다음 상태 예측을 통해 **비주얼**(pixel-level)이 아닌 **기능적 상태 변화**를 파악함으로써, **실시간 예측 기반**(real-time prediction-based) 위험 평가를 가능하게 하는 것이다. 이는 SAWM 모델을 통해 구현되며, **지시 스크리닝**(Instruction-level Screening)과 **행동 위험 평가**(Action-level Risk Assessment)를 통합적으로 수행한다.
기술적 접근법
- **SeerGuard**는 **지시 수준 스크리닝**(Instruction-level Screening)과 **행동 수준 위험 평가**(Action-level Risk Assessment)의 2단계 프레임워크로 구성됨.
- **SAWM**(Safety-Augmented World Model)은 Qwen3-VL-8B-Instruct 기반으로, **다중 작업 학습**(multi-task learning)을 통해 **지시 분석**, **다음 상태 예측**, **안전 평가**를 통합적으로 수행함.
- **입력**: 스크린샷과 후보 행동 → **출력**: 세마틱 다음 상태, 안전 평가, 간략한 근거.
- **학습 데이터**: 일반 텍스트 안전 데이터, 다중 모달 모바일 위험 데이터, 합성 텍스트 모바일 위험 데이터를 결합한 **안전 증강 전략** 사용.
- **하이퍼파라미터**: Safety-Utility Score는 $\omega=0.8$, Risk-Cost Score는 $\alpha=0.8$에서 평가됨.
주요 결과
- Qwen3-VL-8B-Instruct에서 **Safety-Utility Score**는 0.191 → 0.596 (+212.0%), **Risk-Cost Score**는 0.347 → 0.130 (-62.5%)로 개선됨.
- **6개 태스크 카테고리**(예: Finance, Web Nav, Social 등)에서 **고위험 행동 거부율**이 증가함.
- **실행 시간**(latency)은 Qwen3-VL 기반 에이전트에서 3.49분 → 3.35분으로 **감소**함.
- **1-RCS**(Risk-Cost Score의 보완 지표)와 **SUS**(Safety-Utility Score)가 모두 향상됨.
의의 및 한계
SeerGuard는 모바일 GUI 에이전트의 **실행 전 위험 예측**을 가능하게 하여, 기존의 **반응형**(reactive) 안전 메커니즘의 한계를 극복한다. 특히, **세마틱 예측 기반**의 접근은 **비주얼 예측**보다 실용적이고 계산 비용이 적은 장점을 가진다. 또한, **다중 작업 학습**(multi-task learning)을 통해 **지시 수준**과 **행동 수준**의 안전 평가를 통합적으로 수행함으로써, **안전성과 유용성**(safety-utility trade-off)을 균형 있게 유지할 수 있다. 그러나, **모델별 성능 차이**(Gemini-3.1, Qwen3-VL, GPT-5.1 간)가 존재하며, 일부 **세부 작업**(fine-grained tasks)에서는 **위험 탐지 누락**(missed detection)이나 **양성 오인**(false positive)이 발생할 수 있다. 이는 **모델의 내재적 계획 및 접지 능력**(intrinsic planning and grounding behavior)에 따라 달라진다.
실용적 활용
SeerGuard는 **금융 거래**, **예약 시스템**, **소셜 미디어 관리** 등 **즉각적이고 되돌릴 수 없는 행동**이 필요한 모바일 환경에서 **자동화된 GUI 에이전트의 안전성**을 향상시키는 데 활용될 수 있다. 또한, **사전 예측 기반**(pre-execution)의 안전 평가 프레임워크는 **의료 시스템**, **공공 서비스 자동화** 등에서도 적용 가능하다.