Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality

Tri Dao, Albert Gu

arXiv:2405.21060 · 2026-07-27 공개 · arXiv · PDF

language-modeling state-space-models mamba mamba-2 transformers selective-ssm ssm attention

Abstract

While Transformers have been the main architecture behind deep learning's success in language modeling, state-space models (SSMs) such as Mamba have recently been shown to match or outperform Transformers at small to medium scale. We show that these families of models are actually quite closely related, and develop a rich framework of theoretical connections between SSMs and variants of attention, connected through various decompositions of a well-studied class of structured semiseparable matrices. Our state space duality (SSD) framework allows us to design a new architecture (Mamba-2) whose core layer is an a refinement of Mamba's selective SSM that is 2-8X faster, while continuing to be competitive with Transformers on language modeling.

한국어 요약

한 줄 요약

Transformer와 SSM은 구조적 상태 공간 이중성으로 연결될 수 있다.

핵심 기여도

핵심 아이디어

Transformer와 SSM은 서로 다른 아키텍처로 여겨졌으나, 이 연구는 이 둘 사이에 구조적 상태 공간 이중성(SSD)가 존재함을 밝힘. 구조적 반분리 가능 행렬의 다양한 분해를 통해, SSM과 어텐션 메커니즘 간의 수학적 유사성을 이론적으로 설명한다. 이는 기존 Transformer의 계산 복잡도 문제를 SSM의 효율성으로 해결할 수 있는 새로운 통찰을 제공한다. 특히, Mamba-2는 SSD 프레임워크를 기반으로 설계되어, 선택적 상태 공간 모델을 보다 효율적으로 구현함으로써 성능과 속도를 동시에 개선한다.

기술적 접근법

주요 결과

의의 및 한계

이 연구는 Transformer와 SSM의 이론적 유대성을 밝혀, 두 아키텍처의 장점을 결합한 새로운 디자인 가능성을 제시한다. 특히, Mamba-2는 고속 처리와 성능을 동시에 달성함으로써 대규모 언어 모델링 분야에 실질적 기여를 할 수 있다. 다만, SSD 프레임워크의 일반화 가능성과 대규모 데이터셋에서의 확장성은 추가 연구가 필요하다는 한계가 있다.

실용적 활용

Mamba-2는 대규모 언어 모델링, 실시간 자연어 처리, 자원 제약 환경에서의 모델 배포 등에 유용하게 활용될 수 있다. 특히, 고속 처리가 요구되는 산업 현장에서 Transformer 대체 모델로 주목받을 수 있다.