OmniReasoning: Pushing the Limits of Audio-Visual Joint Reasoning
Junming Lin, Yuxuan Wang, Zhenxin Lei, Yuxin Liu, Ruixun Liu, Yinsong Yan, Ling Wang, Minghao Han, Yunfei Chu, Shun Lei, Xueyao Zhang, Qize Yang, Jin Xu, Yiwu Zhong
arXiv:2609.39490 · 2026-10-06 공개 · arXiv · PDF
self-distillation multi-modal long-video audio-visual video-mme qa-generation omni-reasoning omniqb
Abstract
Recent advances have enabled unified omni-modal models in understanding audio, vision, and language. However, existing benchmarks, training data, and learning methods largely treat the modalities independently, leaving the capability of audio-visual joint reasoning poorly evaluated and insufficiently elicited. We address this gap with a benchmark, data engine, and learning method. First, we introduce OmniReasoningBench, a benchmark where both audio and visual evidence are indispensable. It comprises 1,150 multiple-choice and open-ended questions across two tasks, reasoning over video and reasoning beyond video. Second, we develop a data engine OmniQA. It automatically constructs evidence-grounded QA pairs that explicitly necessitate audio-visual joint reasoning, together with time-stamped clue chains that guide the annotation of thinking process. Besides our benchmark, this engine produces training data OmniReasoning-SFT-112K and OmniReasoning-RL-19K. Finally, we propose an on-policy self-distillation method Modality-Factored Self-Distillation (MFSD). It evaluates each sampled response under modality-specific clue contexts, disentangling the contributions of individual clues and their cross-modal interactions for token-level credit assignment. With our training data and learning method, our model OmniReasoning-30B-A3B achieves 50.0% on OmniVideoBench and 42.5% on OmniReasoningBench, improving the base model Qwen3-Omni-30B-A3B-Thinking by 12.8 and 9.3 percentage points, respectively. Moreover, it delivers substantial gains on general and long-video benchmarks, including Video-MME-v2. We hope our work offers a solid step for facilitating future research in omni-modal joint reasoning.
한국어 요약
한 줄 요약
OmniReasoning-30B-A3B는 오디오-비주얼 결합 추론을 강화하기 위해 설계된 벤치마크, 데이터 엔진, 학습 방법을 제시하며 OmniReasoningBench에서 42.5% 성능을 달성한다.
핵심 기여도
- OmniReasoningBench: 오디오와 비주얼 증거가 필수인 1,150개의 QA 쌍을 포함한 새로운 벤치마크.
- OmniQA: 오디오-비주얼 결합 추론을 위한 자동 QA 생성 엔진으로, OmniReasoning-SFT-112K와 OmniReasoning-RL-19K 학습 데이터 생성.
- Modality-Factored Self-Distillation (MFSD): 모달별 증거 맥락에서 토큰 수준의 크레딧 할당을 통해 학습.
- OmniReasoning-30B-A3B 모델: OmniReasoningBench에서 42.5% (기반 모델 대비 +9.3%) 성능 향상.
핵심 아이디어
기존 벤치마크는 오디오-비주얼 결합 추론을 충분히 평가하지 못한다는 문제를 인식하고, OmniReasoningBench를 통해 오디오와 비주얼 정보가 결합되어야 답을 유도할 수 있는 질문을 구성했다. 예를 들어, Figure 1에서 어머니의 태어난 해와 반지에 새겨진 연도 간의 차이를 계산하기 위해 음성 정보와 시각 정보를 결합해야 한다. 기존 모델(Qwen3.5-Plus)은 오디오 없이 평가 시 정확도가 17.2%로 급락하는 반면, OmniReasoningBench는 단일 모달 정보로는 해결 불가능한 문제를 구성함으로써 진정한 결합 추론 능력을 평가한다.
MFSD는 기존의 전체 응답 기반 크레딧 할당 방식을 개선하여, 오디오, 비주얼, 결합 클루 맥락에서 토큰별 기여도를 분리한다. 예를 들어, 각 토큰의 발생 확률을 4가지 클루 조건(무, 오디오, 비주얼, 결합)에서 비교하여, 모달 간 상호작용을 정량화한다. 이는 RLSD와 결합하여 세밀한 토큰 수준의 학습 신호를 제공한다.
기술적 접근법
- **OmniReasoningBench**: 1,150개의 QA 쌍, 두 태스크(Reasoning over video, Reasoning beyond video)로 구성.
- **OmniQA**: 자동 QA 생성 엔진으로, 타임스탬프 기반 클루 체인과 의존성 체인을 생성. OmniReasoning-SFT-112K(112,463개 샘플), OmniReasoning-RL-19K 생성.
- **MFSD**: 오디오, 비주얼, 결합 클루 맥락에서 토큰별 크레딧 할당. λ = β = 0.5로 설정, 오디오/비주얼 인코더는 고정.
- **학습 설정**: SFT 112,463 샘플, GRPO, RLSD, MFSD는 150 스텝, 8개 응답/질문, 256개 배치 크기 사용.
주요 결과
- **OmniReasoning-30B-A3B**: OmniVideoBench에서 50.0% (기반 모델 대비 +12.8%), OmniReasoningBench에서 42.5% (기반 모델 대비 +9.3%) 성능 향상.
- **일반 및 장시간 비디오 벤치마크**: Video-MME-v2 등에서 상당한 성능 향상.
- **단일 모달 실험**: Qwen3.5-Plus는 오디오 없이 17.2% 정확도로, OmniReasoningBench가 결합 추론을 강제함을 보여준다.
의의 및 한계
OmniReasoning은 오디오-비주얼 결합 추론을 평가하고 훈련하는 체계적인 프레임워크를 제공하며, MFSD를 통해 토큰 수준의 모달 기여도를 분리하는 기술적 혁신을 제시한다. 특히, OmniQA는 학습 데이터 생성 과정에서 모달 의존성을 보존하여, 기존의 임의적인 멀티모달 데이터셋과 차별화된다. 그러나, OmniReasoningBench는 1,150개의 QA만 포함되어 있어 대규모 평가에 한계가 있을 수 있으며, MFSD는 오디오/비주얼 인코더를 고정하는 점에서 모델 전체의 학습 가능성에 영향을 줄 수 있다.
실용적 활용
OmniReasoning은 영상 해석, 멀티모달 콘텐츠 분석, 인공지능 기반 교육 시스템 등에서 활용 가능하다. 특히, 오디오와 비주얼 정보를 결합해야 하는 상황(예: TV 방송 분석, 보안 영상 해석)에서 모델의 추론 능력을 향상시키는 데 기여할 수 있다.