VMamba: Visual State Space Model

Yue Liu, Yunjie Tian, Yuzhong Zhao, Hongtian Yu, Lingxi Xie, Yaowei Wang, Qixiang Ye, Yunfan Liu

arXiv:2401.10166 · 2026-07-27 공개 · arXiv · PDF

computer-vision state-space-model vision-backbone selective-scan vmamba ss2d visual-state-space input-scaling

Abstract

Designing computationally efficient network architectures remains an ongoing necessity in computer vision. In this paper, we adapt Mamba, a state-space language model, into VMamba, a vision backbone with linear time complexity. At the core of VMamba is a stack of Visual State-Space (VSS) blocks with the 2D Selective Scan (SS2D) module. By traversing along four scanning routes, SS2D bridges the gap between the ordered nature of 1D selective scan and the non-sequential structure of 2D vision data, which facilitates the collection of contextual information from various sources and perspectives. Based on the VSS blocks, we develop a family of VMamba architectures and accelerate them through a succession of architectural and implementation enhancements. Extensive experiments demonstrate VMamba's promising performance across diverse visual perception tasks, highlighting its superior input scaling efficiency compared to existing benchmark models. Source code is available at https://github.com/MzeroMiko/VMamba.

한국어 요약

한 줄 요약

VMamba는 2D 선택적 스캔과 크로스-스캔 모듈을 결합한 시각 상태 공간 모델로, 높은 성능과 선형 복잡도를 동시에 달성한다.

핵심 기여도

핵심 아이디어

VMamba는 기존 ViT의 글로벌 수용 필드와 동적 가중치의 장점을 유지하면서, 계산 복잡도를 줄이기 위해 상태 공간 모델(S6)을 시각 분야로 확장한 모델이다.
기존 1D 선택적 스캔은 순차적 데이터에 적합하지만, 비순차적 2D 이미지 데이터에 적용할 경우 수용 필드가 제한된다. 이를 해결하기 위해 VMamba는 2D 선택적 스캔(SS2D)과 CSM을 결합하여, 4방향 스캔을 통해 모든 위치의 정보를 통합한다.
CSM은 이미지 특징 맵을 단일 방향이 아닌 4개의 코너에서 대각선 방향으로 순회하며, 각 요소가 다양한 방향의 정보를 수집하도록 한다. 이는 글로벌 수용 필드를 확보하면서도 계산 복잡도를 선형으로 유지한다.

기술적 접근법

주요 결과

의의 및 한계

VMamba는 기존 CNN과 ViT의 장점을 결합한 새로운 기초 모델로서, 높은 성능과 계산 효율성을 동시에 달성하는 데 기여한다.
특히, 글로벌 수용 필드와 동적 가중치를 유지하면서도 선형 복잡도를 보장하는 점에서 학술적·실용적 가치가 높다.
하지만, VMamba-B 모델의 학습 중 버그가 발생하여 최종 성능이 아직 완전히 검증되지 않았다는 한계가 있다.
또한, CSM의 4방향 스캔 전략은 복잡한 구조를 요구하며, 일부 애플리케이션에서는 구현 난이도가 높을 수 있다.

실용적 활용

VMamba는 고해상도 이미지 처리가 필요한 산업 분야(예: 자율주행, 의료 영상 분석)에서 유용하게 활용될 수 있다.
또한, 계산 자원이 제한된 모바일 및 임베디드 시스템에서도 높은 성능과 낮은 FLOPs를 통해 실용성을 확보할 수 있다.
이 모델은 다양한 시각 인식 작업(분류, 객체 탐지, 세분화)에 적용 가능하며, 기존 CNN과 ViT를 대체하거나 보완하는 역할을 할 수 있다.