한 줄 요약
InternLM-XComposer2-4KHD는 4K HD 해상도까지 처리 가능한 최초의 대규모 시각-언어 모델로, 10개 벤치마크에서 GPT-4V와 Gemini Pro를 능가한다.
핵심 기여도
- 4K HD (3840 × 1600) 해상도까지 처리 가능한 최초의 LVLM을 제안.
- 336 × 336 ViT 기반으로 동적 패치 구성과 해상도 조정을 도입.
- 16개 벤치마크 중 10개에서 GPT-4V와 Gemini Pro를 초과, 6개에서 최고 성능 달성.
- 7B 파라미터로도 경쟁력 있는 성능을 보여, 효율적 학습 가능성을 제시.
핵심 아이디어
기존 LVLM은 고해상도 이미지 처리 시 ViT의 고정된 패치 크기와 제한된 해상도 범위로 인해 성능이 제약되었다. InternLM-XComposer2-4KHD는 336 × 336 크기의 ViT를 기반으로, 이미지의 원본 종횡비를 유지하면서 패치 수와 레이아웃을 자동으로 조정하는 **동적 해상도 및 자동 패치 구성** 기법을 도입했다. 이는 고해상도 학습 데이터 부족 문제를 완화하고, 4KHD까지 확장 가능한 학습 환경을 구축한다. 또한, 패치 레이아웃의 변동성을 줄이기 위해 **learnable newline token**을 도입하여 학습 불확실성을 감소시켰다. 이와 같은 접근은 기존 고정 해상도 기반 모델과는 차별화된 유연한 처리 능력을 제공한다.
기술적 접근법
- **Vision Encoder**: OpenAI ViT-Large/14 (336 × 336) 사용.
- **Dynamic Patch Configuration**: 이미지 종횡비 유지하면서 패치 수와 레이아웃을 자동 조정.
- **Learnable Newline Token**: 패치 레이아웃을 명확히 구분하여 학습 불확실성 감소.
- **Global View Patch**: 전체 이미지 매크로 이해를 위한 추가 패치.
- **Training Resolution**: 최대 4K HD (3840 × 1600)까지 확장.
- **Parameter Size**: 7B 파라미터의 InternLM2-7B 기반.
주요 결과
- **16개 벤치마크 중 10개에서 GPT-4V와 Gemini Pro를 초과**.
- **5개 HD-OCR 데이터셋 (DocVQA, ChartQA, InfographicVQA, TextVQA, OCRBench)에서 기존 오픈소스 모델 대비 큰 폭의 성능 향상**.
- **4KHD 학습에서도 성능 정체 없이 지속적으로 향상**.
- **7B 파라미터로도 경쟁력 있는 성능을 보여, 효율적 학습 가능성을 입증**.
의의 및 한계
InternLM-XComposer2-4KHD는 고해상도 이미지 처리를 위한 LVLM의 새로운 기준을 제시하며, 문서, 차트, 인포그래픽 등 세부 정보가 필요한 다양한 분야에 적용 가능하다. 특히, 동적 해상도 조정과 자동 패치 구성은 기존 고정 해상도 기반 모델의 한계를 극복하고, 유연한 입력 처리를 가능하게 한다. 그러나 4KHD 이상의 해상도 학습은 계산 부담이 증가하며, 상용화 시 효율적인 추론 기법이 필요하다는 한계가 있다. 또한, 일부 벤치마크에서 최고 성능을 달성하지 못한 점은 추가 연구가 필요하다.
실용적 활용
이 모델은 문서 처리, 차트 해석, 인포그래픽 분석, 웹 스크린샷 해독 등 고해상도 이미지가 필요한 산업 현장에서 활용 가능하다. 특히, OCR 기반의 자동화 시스템, 디지털 아카이빙, 의료 영상 분석 등에서 유용하게 사용될 수 있다.