한 줄 요약
이미지 기반 추론에서 시각적 도구 사용이 실제 답변에 인과적으로 기여하는지 분석한 연구로, 정책 미조정 문제를 밝혀낸다.
핵심 기여도
- 시각적 도구 사용을 인과 그래프로 모델링하여, 관찰 매개 경로와 행동 유도 단축 경로를 구분.
- 정책, 트레이젝토리, 단계 수준의 3단계 개입을 통해 Visual Evidence Gain(VEG)을 도출.
- 6개 모델, 5개 퍼셉션 벤치마크에서 정책 미조정(Calling Without Looking, Looking Without Planning)을 밝혀냄.
- 정책 수준 정확도 향상이 Calibrated 소수 집단에 집중되어 있음을 밝혀, "시각적 도구 사용의 환상"이라는 개념 제시.
핵심 아이디어
"이미지로 생각하기(thinking-with-images)" 패러다임은 이미지 크롭 및 줌과 같은 시각적 작업을 통해 모델이 보다 세부적인 증거를 수집하도록 지원한다. 하지만 이 작업이 실제 답변에 인과적으로 기여하는지 명확하지 않았다. 이를 분석하기 위해 연구팀은 시각적 도구 사용을 인과 그래프로 모델링하고, 관찰 매개 경로(observation-mediated paths)와 행동 유도 단축 경로(action-induced shortcuts)를 구분했다. 이는 도구 사용이 단순히 텍스트 행동에 의존하는지, 아니면 실제 시각 정보가 답변에 영향을 주는지를 구분하는 데 핵심이다. 또한, 단계 수준 개입을 통해 각 관찰이 답변에 미치는 기여도를 분리하는 VEG(Vision Evidence Gain)를 도입하여, 도구 사용의 실제 효과를 측정했다.
기술적 접근법
- **Policy-level intervention**: 도구 사용과 직접 추론을 비교.
- **Trajectory-level intervention**: 실행 중 모든 관찰을 손상시켜, 관찰-피드백 과정의 변화를 측정.
- **Step-level intervention**: 고정된 접두사 하에 개별 관찰을 카운터패클로 대체, 즉각적 답변 선호도 변화를 탐색.
- **VEG(Vision Evidence Gain)**: 단계 수준에서 각 관찰의 기여도를 분리.
- **Causal Graph**: 입력 이미지 $I$, 쿼리 $Q$, 도구 동작 $T_i$, 관찰 $O_i$, 최종 답변 $Y$를 포함한 인과 관계를 정의.
- **Benchmark**: 5개의 세부 퍼셉션 벤치마크에서 6개의 대표 모델 평가.
주요 결과
- **Calling Without Looking (CWL)**: 관찰 내용이 답변에 인과적으로 영향을 주지 않음.
- **Looking Without Planning (LWP)**: 관찰 내용은 유용하지만, 도구 호출 일정이 비일관적.
- **Trajectory-level 분석**: 정책 수준 정확도 향상이 Calibrated 소수 집단에 집중.
- **VisualProbe 결과**: Qwen3-VL-8B에서 올바른/오답 경로 간 가장 큰 분리, DeepEyes는 관찰 영향이 약함.
- **MCQ 결과**: Mini-o3는 올바른 경로에서 긍정적, 오답 경로에서 부정적 VEG.
- **VEG 분석**: Qwen3-VL-8B의 IQR이 넓어 절대적 비교는 어려움.
의의 및 한계
이 연구는 시각적 도구 사용이 단순히 정확도 향상으로 보이지만, 실제로는 인과적으로 효과적인 경우가 소수라는 점을 밝혀내며, MLLM의 추론 메커니즘에 대한 새로운 인식을 제시한다. 특히, 정책 미조정 문제는 도구 사용의 효과를 과대평가할 수 있는 주요 원인으로 드러났다. 그러나 이 분석은 오픈소스 모델에만 적용되었으며, 클로즈드 모델(예: OpenAI o3/o4-mini)에서는 토큰 수준 확률이나 중간 관찰 개입이 불가능해 동일한 결론이 적용되는지 확인할 수 없다는 한계가 있다. 또한, VEG는 단계 수준 분석에 유용하지만, 개별 관찰의 절대적 기여도를 정량적으로 비교하기는 어렵다.
실용적 활용
이 연구는 MLLM의 추론 과정을 더 깊이 있게 이해하고, 도구 사용 정책을 개선하는 데 활용될 수 있다. 특히, VEG와 트레이젝토리 수준 진단은 모델의 추론 일관성과 효과성을 평가하는 데 유용하며, 교육, 의료, 자동화 시스템 등에서 시각 정보 기반 추론의 신뢰도를 높이는 데 기여할 수 있다.