한 줄 요약
AdvSim2Real은 웹 에이전트의 안정성과 능력을 동시에 향상시키기 위해 웹 월드 모델 내에서 커리큘럼, 에이전트, 적대자 정책을 공진화시키는 시뮬레이션 기반 훈련 방법이다.
핵심 기여도
- **AdvSim2Real**이라는 새로운 훈련 프레임워크를 제안하여, 웹 월드 모델 내에서 커리큘럼, 적대자, 에이전트를 공진화시킴.
- **Qwen3.5-4B** 에이전트를 사용한 실험에서, 150개 웹 태스크에서 **33.6% 상대적 완료율 향상**을 달성.
- **WebWorld-14B** 월드 모델을 기반으로 **실제 브라우저 환경으로의 이전 성능**도 25.56% → 44.44%로 증가.
- **Kimi-K3**라는 미학습 적대자에 대해 23.00% → 30.72%로 완료율 향상.
핵심 아이디어
기존 방어 방법은 정적 인젝션 예시로 훈련하여 적응형 공격을 막지 못했다. AdvSim2Real은 웹 월드 모델 내에서 **커리큘럼**, **적대자**, **에이전트**를 동시에 훈련함으로써, 에이전트가 새로운 공격에 대응하는 능력을 키운다. 커리큘럼은 에이전트가 약 50% 성공하는 태스크를 제안하여 학습 효과를 극대화하고, 적대자는 **성공 플립**(success flip)이라는 지표로 보상받는다. 이는 정상 실행이 실패로 전환될 때만 보상이 주어지는 방식으로, 공격의 효과성을 정확히 평가한다.
기술적 접근법
- **AdvSim2Real**은 **WebWorld-14B** 월드 모델 내에서 3개 정책(커리큘럼, 에이전트, 적대자)을 훈련.
- **Stage 1**: 커리큘럼과 에이전트가 번갈아 업데이트되며, 커리큘럼은 에이전트가 약 50% 성공하는 태스크를 제안.
- **Stage 2**: 커리큘럼 고정, 적대자와 에이전트가 번갈아 업데이트. 적대자는 **성공 플립**을 기준으로 보상.
- **Executor update**: 성공률에 따라 보상이 조정되며, **q(p) = 1 − 2|p − 1/2|** 공식을 사용해 보상 계산.
- **Adversary reward**: **b_i^α, v_i^α ∈ {0,1}**로 공격 성공 여부를 판단하고, **n_A(z)**로 유사성 클러스터를 고려한 페널티 적용.
주요 결과
- **150개 웹 태스크**에서, **Kimi-K3** 적대자에 대해 완료율이 **23.00% → 30.72%**로 **33.6% 상대적 향상**.
- **Stage 1**에서 **74.89% → 79.33%**로 **4.44% 절대적 향상**.
- **실제 브라우저**에서 **25.56% → 44.44%**로 **18.88% 절대적 향상**.
- **Stage 2**에서 공격 상황 완료율은 **48.07% → 57.48%**로 **9.41% 절대적 향상**.
의의 및 한계
AdvSim2Real은 웹 에이전트의 **능력과 안정성**을 동시에 향상시키며, 특히 **적응형 공격**에 효과적이다. 월드 모델 내에서 훈련한 성능이 실제 브라우저로 이전되는 점은 실용성 측면에서 중요한 기여다. 그러나 **Stage 2**는 월드 모델 내에서만 평가되며, 브라우저 환경에서의 공격 대응력은 명시되지 않았다. 또한, **적대자의 공격 가능성**(feasibility)을 평가하지 않는 점도 한계로 지적된다.
실용적 활용
AdvSim2Real은 웹 기반 자동화 시스템, 특히 **고객 관리, 데이터 수집, 온라인 트랜잭션** 등에서 공격에 강한 에이전트를 구축하는 데 활용 가능하다. 월드 모델 기반 훈련은 실제 환경으로의 이전을 용이하게 하므로, **보안이 중요한 산업**(금융, 의료, 정부)에서 실용적 가치가 높다.