한 줄 요약
ShowUI는 UI-가이드 토큰 선택, 인터리브 스트리밍, 고품질 데이터셋을 결합한 2B 파라미터 GUI 시각 에이전트 모델로, 75.1%의 제로샷 정확도를 달성한다.
핵심 기여도
- **UI-Guided Visual Token Selection**: UI 연결 그래프를 기반으로 토큰 선택을 수행하여 33%의 불필요 토큰을 제거하고 1.4×의 성능 가속화를 달성.
- **Interleaved Vision-Language-Action Streaming**: 시각-언어-액션의 복합적 관계를 유연하게 처리하여 훈련 효율성 향상.
- **Small-scale High-quality GUI Instruction-following Dataset**: 256K 데이터로 구성된 고품질 데이터셋을 통해 75.1%의 제로샷 정확도 달성.
- **2B 파라미터의 가벼운 모델**: 높은 성능을 유지하면서도 계산 비용을 줄인 경량화 모델 구현.
핵심 아이디어
ShowUI는 GUI 시각 에이전트의 핵심 문제인 고해상도 이미지 처리, 복잡한 모달 간 상호작용, 불균형 데이터셋을 해결하기 위해 세 가지 핵심 아이디어를 제시한다. 첫째, UI-Guided Visual Token Selection은 UI 스크린샷을 노드로 표현하고 연결 성분을 기반으로 토큰 선택을 수행함으로써 불필요한 계산을 줄인다. 둘째, Interleaved Vision-Language-Action Streaming은 액션, 시각, 언어 정보를 병렬적으로 처리하여 훈련 효율성을 높인다. 셋째, 데이터셋은 22K 웹 데이터와 2K OmniAct 데이터를 기반으로 구성되며, 정적 텍스트는 정보성이 낮아 필터링되어 모델 성능에 영향을 주지 않는다.
기술적 접근법
- **모델 아키텍처**: Qwen2-VL-2B를 기반으로 구축된 2B 파라미터 모델.
- **UI-Guided Token Selection**: RGB 공간에서 패치를 노드로 표현하고 연결 성분을 기반으로 토큰 선택.
- **Interleaved Streaming**: 액션-쿼리, 액션-시각 정보를 병렬적으로 처리하는 스트리밍 구조.
- **데이터셋**: 256K 데이터로 구성된 고품질 인스트럭션 팔로잉 데이터셋.
- **하이퍼파라미터**: 토큰 선택 비율은 0.5로 설정되어 속도와 성능의 균형을 유지.
주요 결과
- **제로샷 스크린샷 지정 정확도**: 75.1% (기존 베이스라인 대비 +10% 이상).
- **UI-Guided Token Selection 효과**: 훈련 중 33%의 불필요 토큰 제거, 1.4× 성능 가속화.
- **웹, 모바일, 온라인 환경 내비게이션 성능**: 다양한 환경에서 뛰어난 내비게이션 능력 보임.
- **데이터셋 효과**: 22K 웹 데이터가 270K SeeClick 데이터보다 우수한 성능을 보임.
의의 및 한계
ShowUI는 GUI 시각 에이전트 분야에서 고해상도 이미지 처리, 복잡한 모달 간 상호작용, 불균형 데이터셋 문제를 효과적으로 해결한 첫 번째 통합 모델로, 향후 인간과 유사한 인터페이스 인지 능력을 갖춘 에이전트 개발에 기여할 수 있다. 그러나 모델은 오프라인 데이터에만 기반하며, 온라인 환경에서의 실시간 학습 능력은 아직 부족하다. 또한, 액션 공간의 복잡성과 다양한 장치 간 차이를 완전히 모델링하지 못하는 한계가 존재한다.
실용적 활용
ShowUI는 웹, 모바일, 온라인 환경에서 사용자 인터페이스를 시각적으로 인식하고 내비게이션을 수행하는 GUI 에이전트로 활용 가능하다. 특히, 슬라이드 제작, 자동화된 UI 테스팅, 장애인 지원 액세서리 도구 등에 적용할 수 있으며, 사용자 작업 흐름을 자동화하여 생산성을 향상시킬 수 있다.