Intern-S2-Mobius: Foundation Model with Decoupled Knowledge and Reasoning
Kai Chen, Jifeng Ding, Ning Ding, Jiaye Ge, Lixin Gu, Yicheng Gu, Qipeng Guo, Ermo Hua, Haian Huang, Haozheng Hou, Jie Hou, Xiangyu Hong, Che Jiang, Minxi Jin, Cheng Liang, Dahua Lin, Dawei Liu, Kuikun Liu, Chengqi Lv, Haijun Lv, Han Lv, Ningsheng Ma, Biqing Qi, Jianmin Qian, Shiya Su, Youbang Sun, Huanze Tang, Zhongbo Tian, Hanjing Wang, Rui Wang, Ting Wang, Yi Wang, Baiting Wu, Jun Xu, Bowen Yang, Hui Wang, Weida Wang, Haochen Ye, Jiashuo Yu, Shan Yu, Xiaoyi Yu, Qirui Zeng, Qi Zhang, Ming Zhang, Wenwei Zhang, Bowen Zhou, Xinyu Zhou
arXiv:2608.14290 · 2026-08-17 공개 · arXiv · PDF
foundation-model inference-speedup continual-pretraining knowledge-reasoning-separation training-data-efficiency transformer-baseline memory-ffn reasoner-self-attn
Abstract
We introduce Mobius-v0, an architecture that comprises a globally shared Memory (FFN) that stores knowledge vectors and multiple Reasoners (Self-Attn) that iteratively achieve compositional reasoning. Using hidden states as cache and carrier, reasoners repeatedly query memory for required knowledge-vectors, while the knowledge is transmitted back to reasoning operators. Through this knowledge-reasoning-separation architecture, Mobius achieves better knowledge compression and reasoning efficiency. Built upon Mobius-v0 architecture: 1) Our 7B model trained-from-scratch achieves similar downstream score as a 7B Transformer baseline with 62.6% of baseline's training data. 2) Our Intern-S2-Mobius, continually-pretrained from Qwen3.5-35B, achieves similar downstream score while delivering nearly 4x end-to-end inference speedup.
한국어 요약
한 줄 요약
Mobius-v0는 지식 저장과 추론 계산을 분리한 아키텍처로, 4× 추론 가속과 62.6% 훈련 데이터 절감을 달성한다.
핵심 기여도
- Mobius-v0 아키텍처를 제안: FFN 기반 Memory와 Self-Attn 기반 Reasoners로 구성.
- 7B 모델이 62.6%의 훈련 데이터로 기존 7B Transformer와 유사한 downstream 성능 달성.
- Intern-S2-Mobius는 Qwen3.5-35B에서 연속 훈련하여 4× 추론 속도 향상.
핵심 아이디어
Mobius-v0는 Transformer의 정보 흐름을 재설계하여 지식 저장과 추론을 분리한다. 이는 FFN 기반 Memory가 지식 벡터를 저장하고, Self-Attn 기반 Reasoners가 반복적으로 Memory를 쿼리하며 추론을 수행하는 방식이다. Hidden states는 캐시와 운반체 역할을 하며, 지식이 추론 연산자로 전달된다. 이 분리 구조는 지식 압축 효율성과 추론 성능 향상을 동시에 달성할 수 있다는 통찰에 기반한다.
기술적 접근법
- **Mobius-v0 아키텍처**: FFN 기반 Memory와 Self-Attn 기반 Reasoners로 구성.
- **Hidden states 활용**: 캐시 및 지식 운반 역할.
- **7B 모델**: 훈련 데이터 62.6% 절감.
- **Intern-S2-Mobius**: Qwen3.5-35B에서 연속 훈련.
- **추론 속도**: 기존 대비 4× 가속.
주요 결과
- 7B 모델이 기존 7B Transformer와 유사한 downstream 성능을 62.6%의 훈련 데이터로 달성.
- Intern-S2-Mobius는 기존 모델 대비 4× 빠른 end-to-end 추론 속도를 보임.
의의 및 한계
Mobius-v0는 지식 저장과 추론을 분리함으로써 모델의 효율성과 확장성을 동시에 개선한다. 특히, 훈련 데이터 절감과 추론 속도 향상은 대규모 모델의 실용성을 높이는 데 기여할 수 있다. 그러나, Mobius의 내부 정보 흐름이 복잡하기 때문에, 추론 과정에서의 안정성과 오류 전파 가능성은 추가 연구가 필요하다.
실용적 활용
Mobius-v0는 대규모 언어 모델의 훈련 데이터 절감과 추론 속도 향상이 필요한 산업 분야, 특히 클라우드 인프라 및 모바일 기기에서 실시간 추론이 요구되는 상황에 적합하다.