한 줄 요약
이미지넷 분류에서는 Mamba가 불필요하지만, 감지 및 세그멘테이션에서는 잠재력이 있다.
핵심 기여도
- Mamba는 **long-sequence** 및 **autoregressive** 특성을 가진 작업에 적합하다는 개념적 결론 도출.
- **ImageNet 분류**는 두 특성 모두 충족하지 않아 Mamba가 불필요하다는 가설 제시 및 실험 검증.
- **감지 및 세그멘테이션**은 long-sequence만 충족하므로 Mamba의 잠재력이 남아 있다는 가설 제시 및 검증.
- **MambaOut** 모델을 통해 Mamba의 핵심인 SSM을 제거한 실험 수행, ImageNet에서 기존 Mamba 모델을 초과.
핵심 아이디어
Mamba는 RNN과 유사한 **structured state space model (SSM)**을 기반으로 하며, **long-sequence** 및 **autoregressive** 작업에 적합하다는 점에서 기존 Transformer의 제한을 극복할 수 있다는 기대가 있었다. 그러나 시각 작업은 대부분 **비자연적**(non-autoregressive)이며, 전체 이미지를 한 번에 볼 수 있어 **causal mode**가 불필요하다. 따라서 Mamba의 핵심인 SSM은 시각 작업에서 오히려 성능 저하 요인이 될 수 있다. 이에 따라, 저자는 **Gated CNN** 기반의 **MambaOut** 모델을 제안하며, SSM을 제거한 형태로 Mamba의 필요성을 검증한다.
기술적 접근법
- **MambaOut**: Mamba 블록을 사용하지만, 핵심인 **SSM**을 제거한 **Gated CNN** 기반 모델.
- **비교 대상**: Vision Mamba, VMamba, LocalMamba, PlainMamba 등 기존 시각 Mamba 모델.
- **데이터셋**: ImageNet (이미지 분류), COCO (감지), ADE20K (세그멘테이션).
- **모델 구성**: Mamba 블록 대신 Gated CNN 블록을 스택하여 구축.
- **평가 지표**: 정확도 (ImageNet), mAP (COCO), mIoU (ADE20K).
주요 결과
- **ImageNet 분류**: MambaOut은 기존 시각 Mamba 모델을 초과하여 **정확도 +1.2%** 개선.
- **COCO 감지**: MambaOut은 기존 Mamba 기반 모델보다 **mAP -2.1%** 낮음.
- **ADE20K 세그멘테이션**: MambaOut은 기존 Mamba 기반 모델보다 **mIoU -3.4%** 낮음.
- 이는 **ImageNet**에서는 Mamba가 불필요하지만, **감지 및 세그멘테이션**에서는 여전히 잠재력이 있음을 시사.
의의 및 한계
- **의의**: Mamba의 핵심인 SSM이 시각 작업에서 불필요할 수 있음을 개념적·실험적으로 입증.
- **한계**: Mamba의 잠재력은 감지 및 세그멘테이션에서만 일부 보여지며, 전체 시각 작업에 대한 일반화는 제한적.
- **추가 연구 필요**: RNN과 Transformer의 통합, LLM 및 LMM에의 Mamba 적용 가능성.
실용적 활용
- **이미지넷 분류**에서는 Mamba 대신 **MambaOut**과 같은 간단한 CNN 기반 모델이 더 효율적.
- **감지 및 세그멘테이션**에서는 Mamba의 잠재력을 활용한 모델 개발이 유망.
- **자원 효율성**을 고려한 모델 설계에 MambaOut이 자연스러운 기준이 될 수 있음.