한 줄 요약
시각 인코더를 제거한 MLLM이 10²² FLOPs 규모에서 기존 인코더 기반 모델과 성능이 수렴할 수 있음을 규모 법칙을 통해 밝힘.
핵심 기여도
- 시각 인코더 제거 시 multimodal 목표의 최적 컴퓨팅 할당이 더 큰 모델로 이동 (모델 할당 지수 0.464 → 0.570).
- 10²² FLOPs 규모에서 encoder-free 모델이 기존 모델과 multimodal 성능 수렴 예측.
- 시각 토큰 간 양방향 어텐션, 토큰 처리 층 이동, MoE 전문가 라우팅 집중화 등 디코더 내 시각 인코딩 대체 메커니즘 분석.
- 주제별 성능 격차는 STEM < 차트 < GUI, OCR, 캡션 순으로 좁아짐.
핵심 아이디어
기존 MLLM은 시각 인코더를 통해 사전 학습된 시각 표현을 제공받지만, encoder-free MLLM은 raw pixel에서 직접 시각 표현을 학습한다. 본 연구는 이 두 아키텍처의 규모 법칙을 비교하여, encoder-free 모델이 충분한 규모(10²² FLOPs)에 도달하면 기존 인코더 기반 모델과 성능이 수렴할 수 있음을 밝혔다. 특히, 디코더가 시각 인코더의 역할을 대체하기 위해 시각 토큰 간 양방향 어텐션, 토큰 처리 층 이동, MoE 전문가 라우팅 집중화 등의 적응 메커니즘을 보인다는 점이 핵심 통찰이다. 이는 디코더가 시각 표현 학습을 위한 본질적인 구조적 변화가 필요함을 시사한다.
기술적 접근법
- **모델 래더**: 1.1B–44B 파라미터, 71M–2.4B active 파라미터를 가진 11개의 스파스 MoE 언어 모델 사용.
- **인코더 기반 모델**: SigLIP 2 ViT + ConvPool 어댑터 + 프로젝터 사용.
- **인코더 없는 모델**: raw image patches를 디코더로 직접 입력, 시각 토큰 간 양방향 어텐션 적용.
- **데이터셋**: 동일한 데이터 믹스, 최적화 설정, 시각 토큰 granularity 사용.
- **성능 평가**: 텍스트 및 multimodal 목표에 대해 loss–compute frontier 분석.
- **분석**: 주제별 multimodal loss 분석 (STEM, 차트, GUI, OCR, 캡션 등).
주요 결과
- **10²² FLOPs**에서 encoder-free 모델이 multimodal 성능에서 기존 모델과 수렴 예측.
- **모델 할당 지수**가 0.464 → 0.570으로 증가, 더 큰 모델이 최적.
- **STEM** 주제에서 가장 빠르게 격차 좁아짐, **GUI, OCR, 캡션**은 상대적으로 느림.
- **시각 토큰**은 더 이른 층에서 처리되며, 양방향 어텐션과 MoE 라우팅 집중화가 증가.
의의 및 한계
- **의의**: 인코더 없는 MLLM이 충분한 규모에 도달하면 기존 인코더 기반 모델과 성능이 수렴할 수 있음을 규명. 이는 multimodal pretraining의 새로운 방향성을 제시.
- **한계**: 현재 범위 내에서는 encoder-free 모델이 multimodal 목표에서 더 높은 컴퓨팅 효율성을 보이지 않음. 또한, 실제 10²² FLOPs 규모의 학습이 필요한 점은 실용적 적용에 한계가 있음.
- **추후 연구 필요**: 디코더 아키텍처 및 학습 전략을 통해 시각 입력의 컴퓨팅 효율성을 개선하는 방향이 필요.
실용적 활용
- 대규모 multimodal 모델 개발 시, 인코더 제거를 통해 아키텍처를 단순화하고 통합된 학습을 가능하게 할 수 있음.
- 특히, STEM, 차트 등 언어와 추론에 의존적인 분야에서는 early stage에서 encoder-free 모델의 활용 가능성이 높음.
- 10²² FLOPs 이상의 컴퓨팅 자원이 확보된 클라우드 환경이나 기업 내 연구소에서 실현 가능.