Intern-S2-Preview: Scientific Agentic Foundation Model

Lei Bai, Jiaqi Cao, Chiyu Chen, Guanzhou Chen, Kai Chen, Guangran Cheng, Erfei Cui, Xuanlang Dai, Shengyuan Ding, Shangheng Du, Yanhui Duan, Yue Fan, Youqing Fang, Quan Gan, Yuanyuan Gao, Jiaye Ge, Lixin Gu, Yuzhe Gu, Qipeng Guo, Junjun He, Xin Hong, Ming Hu, Zhouqi Hua, Haian Huang, Junhao Huang, Zixian Huang, Minxi Jin, Lingkai Kong, Alexander Lam, Zehao Li, Zonglin Li, Tianhao Liang, Dahua Lin, Junyao Lin, Tianyang Lin, Zhouhan Lin, Jiangning Liu, Jin Liu, Kuikun Liu, Wenran Liu, Yifei Liu, Yuhong Liu, Yuhong Liu, Zhoumianze Liu, Ziyan Liu, Ziyu Liu, Haijun Lv, Han Lv, Chengqi Lyu, Le Ma, Ningsheng Ma, Zerun Ma, Haoyang Peng, Runyu Peng, Jifei Shan, Zixin Shang, Kou Shi, Xiang Shi, Qisheng Su, Xuerui Su, Hao Sun, Xiao Sun, Yanan Sun, Yu Sun, Huanze Tang, Yinghao Tang, Wenhui Tian, Zhongbo Tian, Bingli Wang, Haomin Wang, Jiarui Wang, Jingzhi Wang, Rui Wang, Xiquan Wang, Yi Wang, Zhecan Wang, Ziyi Wang, Zun Wang, Rubin Wei, Lianyi Wu, Wen Wu, Yue Wu, Yuhan Wu, Zhenyu Wu, Zijian Wu, Shuhao Xing, Jun Xu, Xingle Xu, Xuenan Xu, Xiangchao Yan, Ziang Yan, Bowen Yang, Danni Yang, Lin Yang, Zhiqi Yang, Qian Yao, Haochen Ye, Peng Ye, Jinhui Yin, Jiashuo Yu, Dingbo Yuan, Fei Yuan, Yuhang Zang, Bo Zhang, Chao Zhang, Chen Zhang, Hongjie Zhang, Junming Zhang, Wenlong Zhang, Wenwei Zhang, Yiming Zhang, Zhuo Zhang, Ziyang Zhang, Haiteng Zhao, Penghao Zhao, Yibo Zhao, Zhonghan Zhao, Zhihang Zhong, Bowen Zhou, Peiheng Zhou, Xin Zhou, Xinyu Zhou, Yunhua Zhou, Dongsheng Zhu, Yicheng Zou

arXiv:2608.13505 · 2026-08-14 공개 · arXiv · PDF

reinforcement-learning speculative-decoding model-distillation multimodal-reasoning agentic-rl long-horizon-tasks scientific-agents time-series-modeling

Abstract

Scientific discovery increasingly requires AI systems that can reason over scientific evidence of heterogeneous modalities, interact with scientific tools and environments, and sustain progress across long task horizons. We present Intern-S2-Preview, a series of scientific agentic foundation models designed to support multimodal scientific understanding, reasoning, generation, and long-horizon tasks. The training pipeline begins with scientific multimodal pre-training over rendered scientific documents, interleaved image-text data, and diverse scientific corpora. Starting from the pretrained checkpoint, we apply a unified post-training pipeline consisting of supervised fine-tuning, scalable multi-task reinforcement learning (RL), black- and white-box agentic RL, and on-policy distillation. This pipeline is supported by practical techniques that improve rollout and training stability and efficiency, including partial rollout with off-policy correction, adaptive length regularization, online speculative decoding, robust multi-task optimization, and trace-aware experience assembly for agentic tasks. At the architecture level, Intern-S2-Preview-397B extends time series modelling from efficient long-sequence understanding to numerical forecasting, while Memory Decoder is studied as a separate memory-augmented path for rapid scientific specialization without modifying the frozen 397B backbone. Evaluations across scientific, multimodal, agentic, and general-purpose benchmarks show that Intern-S2-Preview-397B achieves competitive or leading results in multiple settings. The time series modules improve scientific signal understanding and forecasting on SciTS, while the separate Intern-MemDec-4B extension improves the Biology-Instructions average score from 56.92 to 60.32 without modifying the frozen 397B backbone.

한국어 요약

한 줄 요약

Intern-S2-Preview-397B는 과학적 추론, 도구 상호작용, 장기적 작업을 지원하는 다중 모달 과학 에이전트 기반 모델이다.

핵심 기여도

핵심 아이디어

과학적 발견은 단일 질문에 대한 답변을 넘어, 이질적인 증거를 기반으로 반복적 도구 상호작용과 장기적 작업을 요구한다. Intern-S2-Preview는 이러한 과학 워크플로우를 지원하기 위해, **다중 모달 이해**, **도구 기반 추론**, **장기적 작업 수행**을 통합한 에이전트 기반 기반 모델을 제안한다.

모델은 **Time Series 모듈**을 통해 과학적 신호를 이해하고 예측하며, **Memory Decoder**를 통해 외부 파라미트릭 메모리를 연결하여 특정 도메인 지식을 추가할 수 있다. 이는 397B 백본 파라미터를 수정하지 않으면서도 빠른 도메인 적응을 가능하게 한다.

기술적 접근법

주요 결과

의의 및 한계

Intern-S2-Preview-397B는 과학적 추론과 도구 상호작용을 통합한 **에이전트 기반 기반 모델**로서, 단일 질문 응답을 넘어 **반복적, 실행 가능한 과학적 워크플로우**를 지원하는 데 기여한다. 특히, Memory Decoder를 통해 **397B 백본을 수정하지 않고도 도메인 특화**가 가능하다는 점에서 실용적 가치가 있다.

하지만, 모델은 여전히 **장기적 과학적 워크플로우의 신뢰성** 향상이 필요하며, **도메인별 메모리 확장**과 **전문 과학 도구 통합**이 추가 연구 주제로 남아 있다.

실용적 활용

이 모델은 **생물학, 물리, 환경 과학 등 다양한 과학 분야**에서 장기적 연구 프로젝트, 실험 설계, 도구 기반 분석에 활용 가능하다. 특히, **Memory Decoder**는 연구실에서 빠른 도메인 적응이 필요한 상황에서 유용하며, **Time Series 모듈**은 기후 모델링, 실험 데이터 분석 등에 적용할 수 있다.