한 줄 요약
EASEL은 시각적 정밀도가 요구되는 다중 모달 에이전트의 도구 사용 능력을 평가하는 새로운 벤치마크로, 440,000개 샘플의 EASEL-Data와 9B 파라미터 모델 EASEL-9B를 제시한다.
핵심 기여도
- **EASEL** 벤치마크를 제안하여, 시각적 정밀도가 요구되는 다중 모달 에이전트의 도구 사용 능력을 평가.
- **EASEL-Data**는 440k 샘플을 포함한 2단계 커리큘럼 데이터셋으로, 트래젝토리 감독을 위한 학습 자료 제공.
- **EASEL-9B** 모델은 EASEL-Data를 기반으로 학습되어 기존 모델 대비 6.3% 상대 성능 향상.
- **재구성 유사도**가 0.40–0.54 범위로 낮게 유지되며, **트래젝토리 불안정성**이 주요 실패 요인으로 드러남.
핵심 아이디어
기존의 QA 중심 평가에서 벗어나, 외부 도구를 통해 행동하는 에이전트의 능력을 평가하는 새로운 패러다임이 필요하다. 특히, **dexterous visual tool use**는 시각적 증거를 바탕으로 도구 파라미터를 추론하고, 그 파라미터가 직접 최종 결과를 결정하는 **정밀한, 폐쇄 루프의 시각적 행동**을 의미한다. EASEL은 이를 평가하기 위해 **reference-guided visual reconstruction**을 주요 태스크로 채택한다. 에이전트는 참조 이미지를 바탕으로 캔버스를 점진적으로 그려가며, 각 단계에서 **시각적 피드백을 기반으로 정확한 파라미터를 결정**해야 한다. 이는 단순한 추론이 아닌, **시각적 이해를 정밀한 실행 파라미터로 변환하는 능력**을 평가한다.
기술적 접근법
- **EASEL**은 **110개의 참조 기반 재구성 샘플**과 **5개의 자연어 조건부 의미 태스크**로 구성.
- **EASEL-Data**는 **440k 샘플**을 포함한 2단계 커리큘럼 데이터셋으로, **C1: early reconstruction**, **C2: light completion** 단계로 나뉨.
- **EASEL-9B**는 EASEL-Data를 기반으로 2단계 커리큘럼 학습을 거침: **초기 단계 스트로크 학습** → **중간~후반 단계 확장**.
- **모델 인터페이스**는 최소한으로 유지되며, 재구성 시 **참조 이미지, 현재 캔버스, 브러시 도구 스키마**를 관찰.
주요 결과
- 25개 다중 모달 에이전트를 평가한 결과, **재구성 유사도**는 0.40–0.54 범위로 낮게 유지됨.
- **트래젝토리 진단**에서 **폐쇄 루프 불안정성**이 드러나, 모델은 **초기 포화** 또는 **피크 이후 성능 저하**를 보임.
- **의미 태스크**에서 **정밀 어노테이션**과 **경로 계획** 능력이 뚜렷한 한계를 보임.
- **EASEL-9B**는 기존 모델 대비 **6.3% 상대 성능 향상**을 기록하며, **평가 모델 중 3위**를 기록.
의의 및 한계
EASEL은 기존 QA 평가와 고수준 도구 사용 평가가 무시하는 **시각적 정밀도**와 **폐쇄 루프 실행 능력**을 평가하는 데 기여한다. 특히, **정밀한 시각적 이해를 실행 파라미터로 변환하는 능력**을 평가함으로써, 모델의 **실제 세계 적용 가능성**을 보다 정확히 측정할 수 있다. 그러나 EASEL은 **2D 이미지 기반**이며, **3D 환경**이나 **실시간 상호작용**을 고려하지 않아 한계가 있다. 또한, **정확한 피드백 기반 수정 능력**은 여전히 제한적임.
실용적 활용
EASEL은 **디지털 환경에서 정밀한 시각적 작업**이 필요한 산업, 예를 들어 **UI/UX 디자인**, **로봇 시각 제어**, **자동화된 이미지 편집** 분야에서 모델 평가에 활용될 수 있다. 또한, **다중 모달 에이전트의 정밀도 기반 학습 전략** 개발에도 기여할 수 있다.