LongVILA: Scaling Long-Context Visual Language Models for Long Videos

Fuzhao Xue, Yukang Chen, Dacheng Li, Qinghao Hu, Ligeng Zhu, Xiuyu Li, Yunhao Fang, Haotian Tang, Shang Yang, Zhijian Liu, Ethan He, Hongxu Yin, Pavlo Molchanov, Jan Kautz, L. Fan, Yuke Zhu, Yao Lu, Song Han

arXiv:2408.10188 · 2026-07-27 공개 · arXiv · PDF

long-context video-understanding multi-modal model-training transformers sequence-parallelism video-benchmarks visual-language

Abstract

Long-context capability is critical for multi-modal foundation models, especially for long video understanding. We introduce LongVILA, a full-stack solution for long-context visual-language models by co-designing the algorithm and system. For model training, we upgrade existing VLMs to support long video understanding by incorporating two additional stages, i.e., long context extension and long video supervised fine-tuning. However, training on long video is computationally and memory intensive. We introduce the long-context Multi-Modal Sequence Parallelism (MM-SP) system that efficiently parallelizes long video training and inference, enabling 2M context length training on 256 GPUs without any gradient checkpointing. LongVILA efficiently extends the number of video frames of VILA from 8 to 2048, achieving 99.8% accuracy in 6,000-frame (more than 1 million tokens) video needle-in-a-haystack. LongVILA-7B demonstrates strong accuracy on 9 popular video benchmarks, e.g. 65.1% VideoMME with subtitle. Besides, MM-SP is 2.1x - 5.7x faster than ring style sequence parallelism and 1.1x - 1.4x faster than Megatron with a hybrid context and tensor parallelism. Moreover, it seamlessly integrates with Hugging Face Transformers.

한국어 요약

한 줄 요약

LongVILA는 2048개의 비디오 프레임을 처리하며 99.8% 정확도를 달성한 장거리 컨텍스트 VLM과 MM-SP 시스템을 결합한 종합 솔루션입니다.

핵심 기여도

핵심 아이디어

LongVILA는 장거리 컨텍스트 비디오 이해를 위한 종합적인 모델-시스템 협업 설계를 제안합니다. 기존 VLM은 8개 프레임만 처리할 수 있었으나, LongVILA는 이를 2048개 프레임까지 확장하여 장거리 비디오의 세부 정보를 정확히 포착합니다. 이는 5단계 훈련 파이프라인과 MM-SP 시스템을 통해 실현됩니다. 특히, MM-SP는 장거리 훈련의 메모리 및 계산 부담을 줄이며, 2M 토큰 길이 훈련을 256 GPU에서 가능하게 합니다. 이는 기존의 고정된 훈련 방식을 넘어, 장거리 데이터를 위한 데이터셋 설계와 훈련 프레임워크를 동시에 제공하는 '풀스택' 접근법의 핵심입니다.

기술적 접근법

주요 결과

의의 및 한계

LongVILA는 장거리 비디오 이해를 위한 풀스택 솔루션으로, 기존 VLM의 단점을 보완합니다. 특히, MM-SP 시스템은 장거리 훈련의 메모리 및 계산 효율성을 획기적으로 개선하며, Hugging Face Transformers와의 호환성을 통해 실용성을 높였습니다. 그러나, 2048개 프레임 이상의 처리는 아직 검증되지 않았으며, 장거리 데이터셋의 품질과 다양성에 따라 성능이 변동될 수 있습니다. 또한, 7B 규모의 모델만 평가되었기 때문에, 더 큰 모델에서의 확장성은 추가 연구가 필요합니다.

실용적 활용

LongVILA는 장거리 비디오 분석이 필요한 산업, 예를 들어, 영상 감시, 자동차 운전 분석, 영상 기반 고객 행동 분석 등에 적용 가능합니다. 또한, 멀티모달 챗봇 및 웹 에이전트 개발에도 활용될 수 있으며, 특히 100만 토큰 이상의 컨텍스트를 처리해야 하는 실시간 영상 분석 시스템에 적합합니다.