한 줄 요약
CLBench-V는 다중 모달 컨텍스트 학습을 평가하기 위한 벤치마크로, 3,443개 인스턴스에서 최고 점수 0.2847를 기록하며 모델의 한계를 드러낸다.
핵심 기여도
- 다중 모달 컨텍스트 학습을 **3단계 구조 (L0, L1, L2)**로 정의: Context Grounding, New Information Application, New Knowledge Learning.
- **CLBench-V**는 공개 벤치마크와 새로 구성된 과학, 금융, 장문 문서 등 5개 도메인 데이터를 결합.
- **InternVL3.5-30B-A3B**는 L0, L2에서 최고 성능, **Qwen3.5-Plus**는 L1에서 최고 성능.
- **자동 생성 및 필터링 절차**를 도입해 도메인별 태스크 생성 비용 절감.
핵심 아이디어
기존 컨텍스트 학습 평가가 텍스트 중심이었으나, 실제 세계에서는 과학, 금융, 웹 정보 등에서 **텍스트와 이미지, 표, 차트가 결합된 다중 모달 컨텍스트**가 흔하다. CLBench-V는 이러한 문제를 해결하기 위해 컨텍스트 학습을 3단계로 구분하고 실패 원인을 정확히 분석할 수 있도록 설계되었다. L0는 컨텍스트 내 증거를 정확히 추출하는 능력을, L1은 새로운 정보를 적용하는 능력을, L2는 새로운 지식을 학습하는 능력을 평가한다. 이 구조는 모델이 어떤 단계에서 실패하는지를 명확히 파악할 수 있게 한다.
기술적 접근법
- **CLBench-V**는 **L0 (Context Grounding)**, **L1 (New Information Application)**, **L2 (New Knowledge Learning)**의 3단계로 구성.
- **Pix2Fact**, **MMLongBench-Pic**, **ReasonMap**, **Paper Conclusion**, **MIRBench**, **Financial Report ROE** 등 6개 데이터셋 사용.
- **자동 생성 및 필터링 절차**를 통해 과학 논문 결론 추론, 금융 보고서 ROE 분석 등 새로운 도메인별 태스크 생성.
- **모델 평가 프레임워크**는 모든 데이터셋에서 일관된 입력 구성, 메타데이터 기록, 답변 추출, 점수 집계를 지원.
- **Qwen3.6-27B**를 주 평가 모델로 사용하며, **정확한 매칭**, **정규화된 정확한 매칭**, **위치 검증**, **LLM 기반 평가** 등 다양한 평가 기준 적용.
주요 결과
- **3,443개 인스턴스**에서 최고 점수는 **0.2847** (모델: InternVL3.5-30B-A3B).
- **L0 (Context Grounding)**: InternVL3.5-30B-A3B가 최고 성능.
- **L1 (New Information Application)**: Qwen3.5-Plus가 최고 성능.
- **L2 (New Knowledge Learning)**: InternVL3.5-30B-A3B가 최고 성능.
- **Pix2Fact**, **BrowseComp-V3**, **CourtSI** 등 데이터셋에서 대부분의 모델이 낮은 성능을 보임.
- **Qwen3.6-27B**는 Pix2Fact, Insight-O3, CL-Bench-Table에서 우수한 성능.
- **GPT-5.4**는 BrowseComp-V3, CourtSI, Financial Report ROE에서 높은 성능.
의의 및 한계
CLBench-V는 다중 모달 컨텍스트 학습을 체계적으로 평가할 수 있는 첫 번째 벤치마크로, 모델이 **어디에서 실패하는지를 정확히 분석**할 수 있다. 특히, **시각적 증거 추출**, **새로운 정보 적용**, **새로운 지식 학습**의 3단계 구조는 모델의 단점을 명확히 드러내며, 학술적 진보와 실용적 개선에 기여할 수 있다. 그러나 일부 데이터셋(예: Pix2Fact, CourtSI)에서는 대부분의 모델이 낮은 성능을 보여, **다중 모달 컨텍스트 학습이 여전히 어려운 문제**임을 나타낸다. 또한, **자동 생성 데이터의 질**과 **LLM 평가의 신뢰성**도 한계로 지적된다.
실용적 활용
CLBench-V는 과학, 금융, 웹 정보 추출 등 **다중 모달 컨텍스트가 필요한 산업 분야**에서 모델 성능을 정확히 평가할 수 있는 도구로 활용될 수 있다. 특히, **문서 분석**, **지도 기반 경로 계획**, **웹 기반 시각 질문 응답** 등에서 모델의 컨텍스트 활용 능력을 진단하고 개선하는 데 유용하다.