Intern-S2-Preview: Scientific Agentic Foundation Model
Lei Bai, Jiaqi Cao, Chiyu Chen, Guanzhou Chen, Kai Chen, Guangran Cheng, Erfei Cui, Xuanlang Dai, Shengyuan Ding, Shangheng Du, Yanhui Duan, Yue Fan, Youqing Fang, Quan Gan, Yuanyuan Gao, Jiaye Ge, Lixin Gu, Yuzhe Gu, Qipeng Guo, Junjun He, Xin Hong, Ming Hu, Zhouqi Hua, Haian Huang, Junhao Huang, Zixian Huang, Minxi Jin, Lingkai Kong, Alexander Lam, Zehao Li, Zonglin Li, Tianhao Liang, Dahua Lin, Junyao Lin, Tianyang Lin, Zhouhan Lin, Jiangning Liu, Jin Liu, Kuikun Liu, Wenran Liu, Yifei Liu, Yuhong Liu, Yuhong Liu, Zhoumianze Liu, Ziyan Liu, Ziyu Liu, Haijun Lv, Han Lv, Chengqi Lyu, Le Ma, Ningsheng Ma, Zerun Ma, Haoyang Peng, Runyu Peng, Jifei Shan, Zixin Shang, Kou Shi, Xiang Shi, Qisheng Su, Xuerui Su, Hao Sun, Xiao Sun, Yanan Sun, Yu Sun, Huanze Tang, Yinghao Tang, Wenhui Tian, Zhongbo Tian, Bingli Wang, Haomin Wang, Jiarui Wang, Jingzhi Wang, Rui Wang, Xiquan Wang, Yi Wang, Zhecan Wang, Ziyi Wang, Zun Wang, Rubin Wei, Lianyi Wu, Wen Wu, Yue Wu, Yuhan Wu, Zhenyu Wu, Zijian Wu, Shuhao Xing, Jun Xu, Xingle Xu, Xuenan Xu, Xiangchao Yan, Ziang Yan, Bowen Yang, Danni Yang, Lin Yang, Zhiqi Yang, Qian Yao, Haochen Ye, Peng Ye, Jinhui Yin, Jiashuo Yu, Dingbo Yuan, Fei Yuan, Yuhang Zang, Bo Zhang, Chao Zhang, Chen Zhang, Hongjie Zhang, Junming Zhang, Wenlong Zhang, Wenwei Zhang, Yiming Zhang, Zhuo Zhang, Ziyang Zhang, Haiteng Zhao, Penghao Zhao, Yibo Zhao, Zhonghan Zhao, Zhihang Zhong, Bowen Zhou, Peiheng Zhou, Xin Zhou, Xinyu Zhou, Yunhua Zhou, Dongsheng Zhu, Yicheng Zou
arXiv:2608.13505 · 2026-08-14 공개 · arXiv · PDF
reinforcement-learning speculative-decoding model-distillation multimodal-reasoning agentic-rl long-horizon-tasks scientific-agents time-series-modeling
Abstract
Scientific discovery increasingly requires AI systems that can reason over scientific evidence of heterogeneous modalities, interact with scientific tools and environments, and sustain progress across long task horizons. We present Intern-S2-Preview, a series of scientific agentic foundation models designed to support multimodal scientific understanding, reasoning, generation, and long-horizon tasks. The training pipeline begins with scientific multimodal pre-training over rendered scientific documents, interleaved image-text data, and diverse scientific corpora. Starting from the pretrained checkpoint, we apply a unified post-training pipeline consisting of supervised fine-tuning, scalable multi-task reinforcement learning (RL), black- and white-box agentic RL, and on-policy distillation. This pipeline is supported by practical techniques that improve rollout and training stability and efficiency, including partial rollout with off-policy correction, adaptive length regularization, online speculative decoding, robust multi-task optimization, and trace-aware experience assembly for agentic tasks. At the architecture level, Intern-S2-Preview-397B extends time series modelling from efficient long-sequence understanding to numerical forecasting, while Memory Decoder is studied as a separate memory-augmented path for rapid scientific specialization without modifying the frozen 397B backbone. Evaluations across scientific, multimodal, agentic, and general-purpose benchmarks show that Intern-S2-Preview-397B achieves competitive or leading results in multiple settings. The time series modules improve scientific signal understanding and forecasting on SciTS, while the separate Intern-MemDec-4B extension improves the Biology-Instructions average score from 56.92 to 60.32 without modifying the frozen 397B backbone.
한국어 요약
한 줄 요약
Intern-S2-Preview-397B는 과학적 추론, 도구 상호작용, 장기적 작업을 지원하는 다중 모달 과학 에이전트 기반 모델이다.
핵심 기여도
- **Multimodal Pre-training**: 렌더링된 과학 문서, 이미지-텍스트 데이터, 다양한 과학 코퍼스를 기반으로 사전 학습.
- **Post-training Pipeline**: 지도 학습, 다중 태스크 강화 학습(RL), 온정책 디스틸레이션을 포함한 통합 후처리 학습.
- **Time Series 모듈**: SciTS에서 과학 신호 이해 및 예측 성능 향상.
- **Memory Decoder**: 397B 백본 수정 없이 생물학 지식 점수 56.92 → 60.32 개선.
핵심 아이디어
과학적 발견은 단일 질문에 대한 답변을 넘어, 이질적인 증거를 기반으로 반복적 도구 상호작용과 장기적 작업을 요구한다. Intern-S2-Preview는 이러한 과학 워크플로우를 지원하기 위해, **다중 모달 이해**, **도구 기반 추론**, **장기적 작업 수행**을 통합한 에이전트 기반 기반 모델을 제안한다.
모델은 **Time Series 모듈**을 통해 과학적 신호를 이해하고 예측하며, **Memory Decoder**를 통해 외부 파라미트릭 메모리를 연결하여 특정 도메인 지식을 추가할 수 있다. 이는 397B 백본 파라미터를 수정하지 않으면서도 빠른 도메인 적응을 가능하게 한다.
기술적 접근법
- **사전 학습**: 렌더링된 과학 문서, 이미지-텍스트 데이터, 다양한 과학 코퍼스를 사용.
- **후처리 학습**: 지도 학습, 다중 태스크 RL, 온정책 디스틸레이션.
- **강화 학습 기술**: 부분 롤아웃(off-policy correction), 적응형 길이 정규화, 온라인 추측 디코딩, GEPO(그룹별 엔트로피 제어 정책 최적화).
- **에이전트 RL 프레임워크**: 허네스 × 태스크 추상화를 기반으로, 다양한 도구 사용 에이전트와 실행 가능한 작업을 공통 프로토콜로 통합.
- **Memory Decoder**: 397B 백본을 수정하지 않고 외부 메모리를 연결하여 생물학 지식 점수를 56.92 → 60.32로 향상.
주요 결과
- **SciTS**: Time Series 모듈을 통해 과학 신호 이해 및 예측 성능 향상.
- **Biology-Instructions**: Memory Decoder 확장 모델(Intern-MemDec-4B)을 통해 평균 점수 56.92 → 60.32 (3.4 포인트 상승).
- **General & Multimodal Tasks**: 경쟁력 있는 성능을 보이며, 개방형 모델 대비 우수한 결과.
- **Agentic Tasks**: 코드 작성, 터미널, 연구 중심 작업에서 경쟁력 있는 성능.
의의 및 한계
Intern-S2-Preview-397B는 과학적 추론과 도구 상호작용을 통합한 **에이전트 기반 기반 모델**로서, 단일 질문 응답을 넘어 **반복적, 실행 가능한 과학적 워크플로우**를 지원하는 데 기여한다. 특히, Memory Decoder를 통해 **397B 백본을 수정하지 않고도 도메인 특화**가 가능하다는 점에서 실용적 가치가 있다.
하지만, 모델은 여전히 **장기적 과학적 워크플로우의 신뢰성** 향상이 필요하며, **도메인별 메모리 확장**과 **전문 과학 도구 통합**이 추가 연구 주제로 남아 있다.
실용적 활용
이 모델은 **생물학, 물리, 환경 과학 등 다양한 과학 분야**에서 장기적 연구 프로젝트, 실험 설계, 도구 기반 분석에 활용 가능하다. 특히, **Memory Decoder**는 연구실에서 빠른 도메인 적응이 필요한 상황에서 유용하며, **Time Series 모듈**은 기후 모델링, 실험 데이터 분석 등에 적용할 수 있다.