한 줄 요약
GUI-Primitives는 GUI 화면에서 공간 관계를 이해하는 능력을 평가하는 대규모 벤치마크로, 기존 모델들이 공간 관계를 파악하는 데 어려움을 겪는 문제를 진단한다.
핵심 기여도
- GUI-Primitives: 994개의 대조 질문 쌍으로 구성된 GUI 공간 관계 평가 벤치마크 (7개 관계: left/right, above/below, containment 등).
- 19개 vision-language 모델 평가 결과, 최고 32%의 strict point-in-box 정확도 달성.
- 예측이 두 후보 영역을 벗어난 비율이 60–92%로, 공간 관계 오류보다 후보 위치 인식 실패가 주요 원인.
- SoM(prompting)는 35–57% 포인트의 정확도 향상을 유도하지만, CoT나 activation steering은 효과 없음.
핵심 아이디어
GUI-Primitives는 GUI 화면에서 자연어 지시에 따라 요소를 정확히 인식하는 능력을 평가하기 위해 설계되었다. 기존 벤치마크는 공간 관계를 독립적으로 평가하지 못했으나, 이 연구는 **대조 질문 쌍**(contrastive instruction pairs)을 통해 동일한 화면과 앵커를 유지하면서 관계 표현만 바꾸어, 정답이 두 후보 사이로 이동하도록 구성하였다. 이는 모델이 공간 관계를 이해하는지, 아니면 단순히 시각적 특징을 기반으로 예측하는지를 구분할 수 있게 한다. 예를 들어, "Save 버튼의 오른쪽"과 "Save 버튼의 왼쪽"이라는 두 지시가 동일한 화면에서 다른 후보를 가리키게 함으로써, 모델이 "오른쪽"이라는 관계 표현을 올바르게 해석하는지 평가한다.
기술적 접근법
- **GUI-Primitives**: 994개의 질문 쌍, 7가지 공간 관계 (left/right, above/below, containment, alignment, proximity, list ordinal, occlusion).
- **평가 지표**: strict point-in-box 정확도, 후보 영역 내 예측 비율, 후보 간 선택 정확도 (0.82–0.90 vs. 0.50).
- **후보 영역 분석**: 예측 좌표가 두 후보 영역을 벗어난 경우를 분류하여, 관계 오해가 아닌 위치 인식 실패를 분리.
- **SoM(prompting)**: 두 후보 영역을 시각적으로 표시하여 모델이 선택 범위를 줄이는 간단한 개입.
- **데이터셋**: UI-Vision, ScreenSpot-Pro.
- **모델**: 19개 vision-language 모델 (GPT-5, Claude Opus 4.7, OS-Atlas 등).
주요 결과
- **GUI-Primitives 정확도**: 19개 모델 중 최고 31% (Claude Opus 4.7), 10개 모델에서 ScreenSpot-Pro 정확도와 Spearman ρ=+0.74 상관 관계.
- **후보 영역 분석**: 60–92%의 예측이 두 후보 영역을 벗어남.
- **관계별 성능**: horizontal position, vertical position, proximity, list ordinal은 0.82–0.90 정확도, containment와 occlusion은 0.50 수준.
- **SoM 효과**: GPT-5는 30% → 87%, OS-Atlas는 10% → 52%로 35–57% 포인트 향상.
의의 및 한계
GUI-Primitives는 기존 벤치마크가 제공하지 못한 **공간 관계 이해 능력의 정량적 평가**를 가능하게 하며, 모델의 주요 실패 원인을 후보 위치 인식 오류로 명확히 진단한다. 이는 GUI grounding 분야에서 모델 개선 방향을 제시하는 중요한 진단 도구이다. 그러나, SoM은 단순히 후보 집합을 제공하는 **진단적 상한**(oracle upper bound)일 뿐, 실제 시스템에 적용 가능한 해결책은 아님. 또한, 모델이 시각적 특징에 의존하는 경향이 여전히 존재하며, 이는 공간 관계를 학습하는 데 필요한 더 깊은 시각-언어 이해 능력의 부재를 드러낸다.
실용적 활용
GUI-Primitives는 GUI 기반 자동화 시스템, 컴퓨터 사용 에이전트, 시각-언어 모델의 평가 및 개선에 활용 가능하다. 특히, 후보 위치 인식 문제를 진단하고, 공간 관계 이해 능력을 개선하기 위한 모델 트레이닝 및 프롬프트 디자인에 기초 자료로 사용될 수 있다.