OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning

Ling Fu, Biao Yang, Zhebin Kuang, Jiajun Song, Yuzhe Li, Linghao Zhu, Qidi Luo, Xinyu Wang, Hao Lu, Mingxing Huang, Zhang Li, Guozhi Tang, Bin Shan, Chunhui Lin, Qi Liu, Binghong Wu, Hao Feng, Hao Liu, Can Huang, Jingqun Tang, Wei Chen, Lianwen Jin, Yuliang Liu, Xiang Bai

arXiv:2501.00321 · 2026-07-27 공개 · arXiv · PDF

benchmark-evaluation logical-reasoning large-multimodal-models multilingual-benchmark visual-text image-annotation text-localization ocr-bench

Abstract

Scoring the Optical Character Recognition (OCR) capabilities of Large Multimodal Models (LMMs) has witnessed growing interest. Existing benchmarks have highlighted the impressive performance of LMMs in text recognition; however, their abilities in certain challenging tasks, such as text localization, handwritten content extraction, and logical reasoning, remain underexplored. To bridge this gap, we introduce OCRBench v2, a large-scale bilingual text-centric benchmark with currently the most comprehensive set of tasks (4x more tasks than the previous multi-scene benchmark OCRBench), the widest coverage of scenarios (31 diverse scenarios), and thorough evaluation metrics, with 10,000 human-verified question-answering pairs and a high proportion of difficult samples. Moreover, we construct a private test set with 1,500 manually annotated images. The consistent evaluation trends observed across both public and private test sets validate the OCRBench v2's reliability. After carefully benchmarking state-of-the-art LMMs, we find that most LMMs score below 50 (100 in total) and suffer from five-type limitations, including less frequently encountered text recognition, fine-grained perception, layout perception, complex element parsing, and logical reasoning. The project website is at: https://99franklin.github.io/ocrbench_v2/

한국어 요약

한 줄 요약

OCRBench v2는 LMM의 시각 텍스트 이해 능력을 체계적으로 평가하기 위한 대규모 이중 언어 벤치마크로, 23개의 핵심 작업과 31개의 다양한 시나리오를 포함한다.

핵심 기여도

핵심 아이디어

OCRBench v2는 기존 OCR 벤치마크가 LMM의 시각 텍스트 이해 능력을 충분히 평가하지 못한다는 문제를 해결하기 위해 설계되었다. 기존 OCRBench는 5개의 핵심 작업만 다루었으나, OCRBench v2는 텍스트 인식, 텍스트 참조, 텍스트 감지, 관계 추출, 요소 파싱, 수학 계산, 시각 텍스트 이해, 지식 추론 등 8가지 핵심 능력을 평가하는 23개의 구체적인 작업을 포함한다. 이는 텍스트가 다양한 형태(예: 손글씨, 복잡한 레이아웃)로 나타나는 실제 환경에서의 모델 성능을 정확히 평가하기 위한 목적으로 설계되었다.

또한, OCRBench v2는 단순한 텍스트 인식을 넘어, 텍스트의 의미를 파악하고, 시각적 요소와의 관계를 이해하는 고급 능력을 평가하는 데 초점을 맞추고 있다. 이는 LMM이 단순 OCR 모델과 구별되는 핵심 능력으로, 기존 벤치마크가 이를 충분히 반영하지 못한다는 점에서 혁신적인 접근이다.

기술적 접근법

OCRBench v2는 다음과 같은 기술적 요소로 구성된다:

주요 결과

의의 및 한계

OCRBench v2는 LMM이 단순 텍스트 인식을 넘어, 시각 텍스트를 이해하고 추론하는 능력을 평가하는 데 중요한 기준을 제공한다. 특히, 23개의 작업과 31개의 다양한 시나리오를 통해 실제 환경에서의 모델 성능을 체계적으로 평가할 수 있다. 또한, 1,500개의 수작업 라벨링된 이미지를 포함한 비공개 테스트셋을 통해 모델의 일반화 능력을 평가하는 데 기여한다.

그러나 OCRBench v2는 아직 일부 한계가 있다. 예를 들어, 특정 언어나 지역에 집중된 데이터셋이 될 수 있으며, 모든 시나리오를 포괄하지 못할 가능성도 있다. 또한, 모델의 텍스트 이해 능력을 평가하는 데 있어, 텍스트 외 다른 시각 요소(예: 이미지, 차트)에 대한 평가가 부족할 수 있다.

실용적 활용

OCRBench v2는 문서 처리, 이미지 내 텍스트 추출, 시각 정보 분석 등 다양한 산업 분야에서 LMM의 성능을 평가하는 데 활용될 수 있다. 특히, 문서 분석, 학술 자료 검색, 고객 서비스 자동화 등에서 모델