VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction

Chaoyou Fu, Haojia Lin, Xiong Wang, Yifan Zhang, Yunhang Shen, Xiaoyu Liu, Yangze Li, Zuwei Long, Heting Gao, Ke Li, Xiawu Zheng, Rongrong Ji, Xing Sun, Caifeng Shan, Ran He

arXiv:2501.01957 · 2026-07-27 공개 · arXiv · PDF

vision-language benchmark-evaluation llm-training multimodal-llm real-time end-to-end vita-1-5 speech-to-speech

Abstract

Recent Multimodal Large Language Models (MLLMs) have typically focused on integrating visual and textual modalities, with less emphasis placed on the role of speech in enhancing interaction. However, speech plays a crucial role in multimodal dialogue systems, and implementing high-performance in both vision and speech tasks remains a significant challenge due to the fundamental modality differences. In this paper, we propose a carefully designed multi-stage training methodology that progressively trains LLM to understand both visual and speech information, ultimately enabling fluent vision and speech interaction. Our approach not only preserves strong vision-language capacity, but also enables efficient speech-to-speech dialogue capabilities without separate ASR and TTS modules, significantly accelerating multimodal end-to-end response speed. By comparing our method against state-of-the-art counterparts across benchmarks for image, video, and speech tasks, we demonstrate that our model is equipped with both strong visual and speech capabilities, making near real-time vision and speech interaction. Code has been released at https://github.com/VITA-MLLM/VITA.

한국어 요약

한 줄 요약

VITA-1.5는 시각·언어·음성 통합을 위한 3단계 훈련 전략을 통해 실시간 멀티모달 대화를 구현한 모델이다.

핵심 기여도

핵심 아이디어

VITA-1.5는 기존 멀티모달 모델들이 주로 시각-언어를 중심으로 설계된 반면, 음성 모달의 중요성을 강조하며, 이를 통합하는 새로운 훈련 전략을 제안한다. 특히, VITA-1.5는 별도의 ASR 및 TTS 모듈 없이 음성 입력을 처리하고 음성 출력을 생성하는 **end-to-end 음성 처리 모듈**을 도입함으로써, 대화 속도를 크게 향상시켰다. 이는 기존 멀티모달 모델에서 흔히 발생하는 **모달 간 충돌** 문제를 완화하기 위한 핵심 아이디어이다. 3단계 훈련 전략은 **시각-언어**, **음성-언어**, **음성-음성** 단계로 구성되어 있으며, 각 단계에서 모델의 학습 방향을 점진적으로 전환함으로써, 모델이 다양한 모달을 유연하게 처리하도록 유도한다.

기술적 접근법

주요 결과

의의 및 한계

VITA-1.5는 멀티모달 대화 시스템에서 음성 모달의 중요성을 강조하며, 별도의 ASR/TTS 모듈 없이도 실시간 음성 대화를 가능하게 함으로써, **실용성과 성능을 동시에 향상**시켰다. 특히, 3단계 훈련 전략은 모달 간 충돌을 완화하고, 모델의 일관된 학습을 유도하는 데 기여한다. 그러나, 구체적인 성능 수치(예: 정확도, F1 점수 등)는 명시되지 않았으며, 특정 음성 데이터셋에서의 성능은 명시되지 않았다는 한계가 있다. 또한, 외부 모듈 없이 음성 처리를 수행하는 방식은 **음성 품질에 민감할 수 있다**는 점도 주목할 만하다.

실용적 활용

VITA-1.5는 **스마트 스피커**, **가상 비서**, **멀티모달 챗봇** 등 실시간 음성-시각 대화가 필요한 산업에 적용 가능하다. 특히, 별도의 ASR/TTS 모듈 없이도 대화를 처리할 수 있어, **시스템 복잡도를 줄이고, 응답 속도를 향상**시킬 수 있는 장점이 있다. 연구 분야에서는 멀티모달 모델의 훈련 전략 개선과 음성-시각 통합 기술 발전에 기여할 수 있다.