Perception Encoder: The best visual embeddings are not at the output of the network
Daniel Bolya, Po-Yao Huang, Peize Sun, J. Cho, Andrea Madotto, Chen Wei, Tengyu Ma, Jiale Zhi, Jathushan Rajasegaran, H. Rasheed, Junke Wang, M. Monteiro, Hu Xu, Shiyu Dong, Nikhila Ravi, Shang-Wen Li, Piotr Doll'ar, Christoph Feichtenhofer
arXiv:2504.13181 · 2026-08-15 공개 · arXiv · PDF
vision-language video-understanding contrastive-training image-retrieval zero-shot-classification perception-encoder spatial-alignment language-alignment
Abstract
We introduce Perception Encoder (PE), a state-of-the-art vision encoder for image and video understanding trained via simple vision-language learning. Traditionally, vision encoders have relied on a variety of pretraining objectives, each tailored to specific downstream tasks such as classification, captioning, or localization. Surprisingly, after scaling our carefully tuned image pretraining recipe and refining with our robust video data engine, we find that contrastive vision-language training alone can produce strong, general embeddings for all of these downstream tasks. There is only one caveat: these embeddings are hidden within the intermediate layers of the network. To draw them out, we introduce two alignment methods: language alignment for multimodal language modeling, and spatial alignment for dense prediction. Together, our PE family of models achieves best-in-class results on a wide variety of tasks, including (1) zero-shot image and video classification and retrieval, simultaneously obtaining 86.6 average zero-shot ImageNet robustness and 76.9 zero-shot Kinetics-400 video classification; (2) document, image, and video Q&A, enabling 94.6 DocVQA, 80.9 InfographicVQA, and 82.7 PerceptionTest with an 8B LLM; and (3) spatial tasks such as detection, tracking, and depth estimation, setting a new COCO state-of-the-art of 66.0 box mAP. To foster further research, we release our models, code, and novel dataset of synthetically and human-annotated videos: https://github.com/facebookresearch/perception_models
한국어 요약
한 줄 요약
Perception Encoder는 단일 대비 학습만으로 이미지와 영상 인식, Q&A, 객체 탐지 등 다양한 작업에서 최고 성능을 달성한 시각 인코더이다.
핵심 기여도
- 대비 학습만으로도 다목적 시각 임베딩을 생성할 수 있음을 입증 (PE core 모델).
- 중간 레이어에서 추출된 임베딩이 AIMv2-3B, DINOv2-g 등 기존 최고 모델과 유사한 성능을 보임.
- 언어 정렬 (language alignment)과 공간 정렬 (spatial alignment)을 통해 다양한 작업에 최적화된 모델 PE lang G, PE spatial G를 제안.
- COCO 탐지 작업에서 66.0 box mAP를 달성하여 새로운 기준을 제시.
핵심 아이디어
기존 시각 인코더는 분류, 캡션 생성, 객체 탐지 등 작업에 맞춘 복잡한 사전 학습 목표를 사용해왔으나, 본 연구는 단일 대비 학습만으로도 다양한 작업에 일반화된 임베딩을 생성할 수 있음을 밝혔다. PE core 모델은 2B 파라미터를 사용한 대규모 이미지-텍스트 데이터로 사전 학습되며, 이 모델의 중간 레이어에서 추출된 임베딩이 이미지 분류, 영상 분류, 객체 탐지 등 다양한 작업에서 뛰어난 성능을 보인다. 이는 기존의 대비 학습이 단순히 글로벌 임베딩만 학습하는 것으로 한정되지 않고, 공간적 특성까지 잠재적으로 학습할 수 있음을 시사한다. 이를 활용하기 위해 언어 정렬과 공간 정렬이라는 두 가지 정렬 방법을 도입하여, 각 작업에 최적화된 출력을 생성한다.
기술적 접근법
- **PE core 모델**: 2B 파라미터를 사용한 대규모 이미지-텍스트 대비 학습 모델.
- **Image pretraining**: 5.4B 개의 이미지-텍스트 쌍으로 학습, 최대 448 픽셀 해상도 사용.
- **Video finetuning**: 영상 데이터 엔진을 통해 재캡션된 22M 개의 영상 샘플로 학습.
- **Language alignment**: 대규모 언어 모델과의 정렬을 통해 MLLM 작업에 최적화된 PE lang G 모델 생성.
- **Spatial alignment**: SAM 2를 활용한 공간 대응 정렬을 통해 객체 탐지, 깊이 추정 등 작업에 최적화된 PE spatial G 모델 생성.
- **Distillation**: 2B 파라미터 모델을 B 및 L 규모로 압축하여 효율적인 모델 생성.
주요 결과
- **Zero-shot 분류**: ImageNet에서 86.6 평균 robustness, Kinetics-400 영상 분류에서 76.9 정확도 달성.
- **Q&A 작업**: 8B LLM과 함께 DocVQA 94.6, InfographicVQA 80.9, PerceptionTest 82.7 성능 보임.
- **객체 탐지**: COCO box mAP에서 66.0 기록, 기존 최고 기준을 경신.
- **대비 학습 기반 모델**: AIMv2-3B 대비 객체 탐지 작업에서 유사한 성능, DINOv2-g 대비 50.9% 개선.
의의 및 한계
Perception Encoder는 단일 대비 학습만으로 이미지와 영상 인식, Q&A, 객체 탐지 등 다양한 작업에서 최고 성능을 달성함으로써, 복잡한 사전 학습 목표를 통합하는 새로운 방향성을 제시한다. 특히, 중간 레이어에서 추출된 임베딩이 다양한 작업에 유용하다는 점은 기존 연구에서 거의 다루어지지 않았던 통찰이다. 그러나 이 임베딩이 네트워크의 끝에서 자연스럽게 출력되지 않기 때문에, 언어 정렬과 공간 정렬이라는 추가적인 정렬 과정이 필요하다는 한계가 있다. 또한, 모델의 규모가 2B 파라미터에 달하므로, 실시간 처리나 자원 제한 환경에서는 활용이 제한될 수 있다.
실용적 활용
Perception Encoder는 이미지와 영상 분류, 객체 탐지, Q&A 등 다양한 시각 작업에 적용 가능하며, 특히 대규모 언어 모델과 결합하여 멀티모달 작업을 수행하는 데 유용하다. 산업적으로는 영상 분석, 문서 이해, 자율 주행 등에서 활용될 수 있으며, 연구적으로는 대비 학습의 잠재력을 탐구하는 데 중요한 기초 자료가 될 수 있다.