한 줄 요약
1시간 길이 동영상에서 8개의 적절히 선택된 프레임이 16개의 균일하게 선택된 프레임보다 6.9점 높은 성능을 보인다.
핵심 기여도
- **Orthogonal Matching Pursuit (OMP)** 알고리즘은 LongVideoBench, Video-MME, LVBench 세 데이터셋에서 기존의 특수 설계된 프레임 선택기와 거의 동등한 성능을 보인다.
- **프레임 선택**은 정확도에 가장 큰 영향을 미치는 단계로, 1시간 길이 동영상에서 8개의 질문 기반 선택 프레임이 16개의 균일 선택 프레임보다 6.9점 높은 성능을 보인다.
- **공간 압축**은 정확도에 거의 영향을 주지 않으며, 프레임당 공간 예산을 반으로 줄여도 최대 0.44점의 손실만 발생한다.
- **재투자**는 압축된 예산을 더 많은 프레임에 할당함으로써 2~3점의 추가 정확도 향상을 달성한다.
핵심 아이디어
동영상 언어 모델은 모든 프레임을 처리할 수 없기 때문에, 어떤 프레임을 선택하고 어떻게 처리하는지가 성능에 직접적인 영향을 미친다. 기존 연구는 프레임 선택, 공간 해상도, 답변 모델 등을 동시에 변경하여 비교하기 때문에, 어떤 요인이 정확도에 기여하는지 명확히 파악하기 어렵다. 본 연구는 **프레임 스코어러**, **프롬프트 경계**, **해상도 정책**, **답변 모델**을 고정한 채, **선택**, **압축**, **재투자** 단계를 독립적으로 변화시켜 비교 실험을 수행한다. 특히, **OMP** 알고리즘은 1993년에 제안된 기존의 스파스 근사 알고리즘으로, 특별히 튜닝 없이도 최신 프레임 선택기와 유사한 성능을 보인다. 이는 프레임 선택이 단순히 알고리즘의 복잡성보다는, 선택된 프레임의 관련성을 어떻게 측정하는지에 달려 있음을 시사한다.
기술적 접근법
- **프레임 선택**: 6가지 훈련 없이 사용할 수 있는 선택 규칙을 사용.
- **공간 압축**: 각 프레임의 공간 예산을 반으로 줄임.
- **재투자**: 압축된 예산을 더 많은 프레임에 할당.
- **데이터셋**: LongVideoBench, Video-MME, LVBench 사용.
- **답변 모델**: Qwen3-VL-8B-Instruct, InternVL3-2B, InternVL3-8B, GPT-5-mini.
- **프레임 스코어러**: LongCLIP 사용.
- **하이퍼파라미터**: 프레임 수 8개, 해상도 고정, 타임스탬프 고정.
- **OMP 알고리즘**: 기존 알고리즘 그대로 사용, 특별히 튜닝 없음.
주요 결과
- **LongVideoBench** 1시간 길이 데이터셋에서, 8개의 질문 기반 선택 프레임이 16개의 균일 선택 프레임보다 6.9점 높은 정확도를 보임.
- **OMP**는 3개의 데이터셋에서 기존의 특수 설계된 선택기와 1점 이내의 차이를 보임.
- **공간 압축**은 프레임당 예산을 반으로 줄여도 최대 0.44점의 정확도 손실만 발생.
- **재투자**는 압축된 예산을 더 많은 프레임에 할당함으로써 2~3점의 추가 정확도 향상을 달성.
- **AKS 기준 모델**에서 발생한 구현 오류와, 동일한 규칙을 동일한 예산으로 실행했음에도 0.07~3.74점의 차이가 발생함.
의의 및 한계
본 연구는 프레임 선택, 압축, 재투자 단계를 독립적으로 분리하여 비교함으로써, 각 단계가 정확도에 미치는 영향을 명확히 파악할 수 있었다. 특히, **OMP** 알고리즘은 특별한 튜닝 없이도 최신 알고리즘과 유사한 성능을 보임으로써, 프레임 선택의 핵심은 알고리즘의 복잡성보다는 선택된 프레임의 관련성 측정에 있다는 점을 입증한다. 그러나, **OMP**의 후반 선택은 시각적으로 새로운 정보를 선택하지만 질문과는 무관한 경우가 발생하며, 이는 한계로 작용한다. 또한, **서브타이틀**이 비활성화되어 있어, 서브타이틀 기반 질문은 부분적으로 접근 불가능하며, 일부 모델의 압축 방식이 다른 모델과 일관되지 않아 비교의 신뢰도가 떨어진다.
실용적 활용
본 연구의 결과는 **동영상 기반 질의 응답 시스템**, **멀티모달 언어 모델**, **동영상 요약 및 분석 플랫폼** 등에 적용 가능하다. 특히, **OMP** 알고리즘은 특별한 튜닝 없이도 높은 성능을 보이므로, **실시간 동영상 처리**, **저예산 환경**, **복잡한 알고리즘 대신 간단한 규칙이 필요한 시스템**에 유용하게 활용될 수 있다.