한 줄 요약
OCRBench v2는 LMM의 시각 텍스트 이해 능력을 체계적으로 평가하기 위한 대규모 이중 언어 벤치마크로, 23개의 핵심 작업과 31개의 다양한 시나리오를 포함한다.
핵심 기여도
- OCRBench v2는 이전 OCRBench 대비 4배 많은 23개의 작업과 31개의 다양한 시나리오를 포함한 대규모 이중 언어 벤치마크를 제안함.
- 10,000개의 인간 검증된 QA 쌍과 1,500개의 수작업 라벨링된 이미지로 구성된 공개 및 비공개 테스트셋을 제공함.
- 6가지 평가 지표(TEDS, IoU, F1, BLEU, METEOR, L1 distance)를 통해 체계적인 평가 프레임워크를 제시함.
- 최신 LMM(Qwen2.5-VL-7B, InternVL3-14B, GPT-4o 등)의 평가를 통해 대부분의 모델이 50점 미만(총 100점)으로 5가지 한계를 드러냄.
핵심 아이디어
OCRBench v2는 기존 OCR 벤치마크가 LMM의 시각 텍스트 이해 능력을 충분히 평가하지 못한다는 문제를 해결하기 위해 설계되었다. 기존 OCRBench는 5개의 핵심 작업만 다루었으나, OCRBench v2는 텍스트 인식, 텍스트 참조, 텍스트 감지, 관계 추출, 요소 파싱, 수학 계산, 시각 텍스트 이해, 지식 추론 등 8가지 핵심 능력을 평가하는 23개의 구체적인 작업을 포함한다. 이는 텍스트가 다양한 형태(예: 손글씨, 복잡한 레이아웃)로 나타나는 실제 환경에서의 모델 성능을 정확히 평가하기 위한 목적으로 설계되었다.
또한, OCRBench v2는 단순한 텍스트 인식을 넘어, 텍스트의 의미를 파악하고, 시각적 요소와의 관계를 이해하는 고급 능력을 평가하는 데 초점을 맞추고 있다. 이는 LMM이 단순 OCR 모델과 구별되는 핵심 능력으로, 기존 벤치마크가 이를 충분히 반영하지 못한다는 점에서 혁신적인 접근이다.
기술적 접근법
OCRBench v2는 다음과 같은 기술적 요소로 구성된다:
- **작업 범위**: 8개의 핵심 OCR 능력(텍스트 인식, 텍스트 참조, 텍스트 감지, 관계 추출, 요소 파싱, 수학 계산, 시각 텍스트 이해, 지식 추론)을 기반으로 23개의 구체적인 작업이 정의됨.
- **데이터셋**: 10,000개의 인간 검증된 QA 쌍과 1,500개의 수작업 라벨링된 이미지로 구성된 테스트셋이 제공됨.
- **평가 지표**: TEDS(구조적 유사도), IoU(텍스트 지역화), F1(관계 추출), BLEU, METEOR, L1 distance(텍스트 수 세기) 등 6가지 평가 지표가 사용됨.
- **모델 평가**: Qwen2.5-VL-7B, InternVL3-14B, GPT-4o 등 최신 LMM이 평가되며, 대부분의 모델이 50점 미만(총 100점)으로 5가지 한계를 드러냄.
주요 결과
- **OCRBench v2 평가 결과**: 대부분의 최신 LMM(Qwen2.5-VL-7B, InternVL3-14B, GPT-4o 등)이 총 100점 중 50점 미만을 기록함.
- **OCRBench v2 vs. OCRBench**: OCRBench에서 Qwen2.5-VL은 88.8%의 정확도를 기록했으나, OCRBench v2에서는 이보다 낮은 성능을 보임.
- **OCRBench v2 vs. DocVQA**: Qwen2.5-VL은 DocVQA에서 96.4%의 정확도를 기록했으나, OCRBench v2에서는 이보다 낮은 성능을 보임.
- **5가지 한계**: 희귀 텍스트 인식, 세부 시각 인식, 레이아웃 인식, 복잡 요소 파싱, 논리적 추론 능력 부족.
의의 및 한계
OCRBench v2는 LMM이 단순 텍스트 인식을 넘어, 시각 텍스트를 이해하고 추론하는 능력을 평가하는 데 중요한 기준을 제공한다. 특히, 23개의 작업과 31개의 다양한 시나리오를 통해 실제 환경에서의 모델 성능을 체계적으로 평가할 수 있다. 또한, 1,500개의 수작업 라벨링된 이미지를 포함한 비공개 테스트셋을 통해 모델의 일반화 능력을 평가하는 데 기여한다.
그러나 OCRBench v2는 아직 일부 한계가 있다. 예를 들어, 특정 언어나 지역에 집중된 데이터셋이 될 수 있으며, 모든 시나리오를 포괄하지 못할 가능성도 있다. 또한, 모델의 텍스트 이해 능력을 평가하는 데 있어, 텍스트 외 다른 시각 요소(예: 이미지, 차트)에 대한 평가가 부족할 수 있다.
실용적 활용
OCRBench v2는 문서 처리, 이미지 내 텍스트 추출, 시각 정보 분석 등 다양한 산업 분야에서 LMM의 성능을 평가하는 데 활용될 수 있다. 특히, 문서 분석, 학술 자료 검색, 고객 서비스 자동화 등에서 모델