过去我们说 AI for Science,经常是在说一个模型能不能回答科学问题:读一段论文、看一张图表、解一道化学题、判断一个蛋白序列。
但真正的科学工作不是单轮问答。
研究人员要读论文、看图表、理解公式、分析实验数据、调用工具、反复验证假设,还要在一个很长的任务链里持续推进。一个只会“答题”的模型,很难自然进入这样的工作流。
这就是 Intern-S2-Preview: Scientific Agentic Foundation Model 想讲的事。
它把科学模型往 Agentic Foundation Model 推了一步:让模型理解科学内容,也面向长程任务、工具交互和多模态证据进行工作。
科学模型为什么不能只看文本
科学知识很少只存在于段落里。
一篇论文里的关键信息,可能藏在 PDF 布局、图表、显微图、遥感图、公式、表格、时间序列和实验流程中。把论文简单抽成纯文本,很多视觉结构和上下文会丢掉。
Intern-S2-Preview 的预训练因此覆盖 rendered scientific documents、interleaved image-text data 和多种科学语料,目标是让模型同时吸收科学文本和页面级视觉信息。
简单说,它希望模型学会两种读法。
一种是像语言模型一样读解析后的文本。
另一种是像看论文页面一样读视觉结构:页面里哪里是图,哪里是表,哪里是公式,图文之间如何互相解释。

这点很重要。科学任务里的“理解”,经常需要把文本、图、表、实验设置合在一起推理。
它真正想做的是科学工作流
论文把 Intern-S2-Preview 定位成一系列 scientific agentic foundation models,主模型是 Intern-S2-Preview-397B。
397B 这个规模很醒目,但这篇更值得关注的是训练路线。
它先做科学多模态预训练,然后进入统一后训练流程:SFT、多任务强化学习、black-box 和 white-box agentic RL、on-policy distillation。
这听起来很复杂,但背后的目标很直接:把预训练里学到的科学知识,转成可控的推理、生成和 agentic 行为。
普通科学问答模型更像“考生”:给一道题,输出答案。
Intern-S2-Preview 想更像“研究助手”:能面对异构证据,能与工具和环境交互,能在较长任务里保持推进。
这也是它适合传播的点。AI Scientist 如果只停留在“刷榜答题”,离真实科研还很远;如果开始面向工具、环境和长程任务训练,才更接近实际科学工作。
后训练的难点:科学任务太杂了
科学任务比通用聊天更难统一。
有的任务是数学推理,有的是生物序列理解,有的是分子生成,有的是时间序列预测,有的是终端或代码环境里的 agentic task。它们的奖励信号、答案形式、推理长度和验证方式都不一样。
Intern-S2-Preview 的后训练里,一个关键工程问题就是:如何稳定地做大规模多任务 RL。
论文提到的技术包括 partial rollout with off-policy correction、adaptive length regularization、online speculative decoding、robust multi-task optimization,以及 trace-aware experience assembly。
这些名词可以先不展开。抓住一个核心就够了:科学 Agent 要训练起来,需要让 rollout、训练、权重同步和任务验证都稳定运转。

论文里说,speculative decoding 在大规模训练中带来约 2 倍 rollout generation 加速,以及 1.7 倍整体 RL 训练流水线加速。这类工程细节说明,Intern-S2-Preview 关注的是“怎么把科学 Agent 真的训起来”。
两个模型能力很值得看
Intern-S2-Preview 里有两个设计尤其适合单独拿出来讲。
第一个是时间序列能力。
科学任务里有大量连续信号:气象、遥感、金融、生命科学实验、传感器数据。论文说 Intern-S2-Preview-397B 把时间序列建模从长序列理解扩展到 numerical forecasting,也就是不仅能看懂信号,还要能预测未来状态。
这让它开始直接处理科学数据本身。
第二个是 Memory Decoder。
科学领域太长尾,没有一个固定 checkpoint 能覆盖所有细分方向。直接为每个领域微调 397B backbone 成本高,也可能破坏通用能力。
论文探索了一条更模块化的路:保持 397B backbone 冻结,把独立训练的 parametric memories 作为 Memory Decoder 接上去,通过 token-level router 动态融合主模型和领域 memory 的分布。
在生物领域实验中,Intern-MemDec-4B 把 Biology-Instructions 平均分从 56.92 提到 60.32,同时尽量保持跨领域表现接近原 backbone。
这和我们之前写过的 Metis 有呼应:大模型的记忆和领域适配,正在从“外挂资料库”变成更底层的模型能力。
实验结果说明什么
论文在科学、多模态、agentic、通用任务和时间序列 benchmark 上评估 Intern-S2-Preview-397B。
作者报告说,它在多个科学 benchmark 上取得竞争性或领先表现,包括 Biology-Instructions、Mol-Instructions、SciReasoner,以及内部的 MP20 和 ProteinBinder-9。通用和多模态任务上,它也在 MMLU-Pro、SimpleQA-Verified、MMMU-Pro、ChartQAPro 等指标上取得开放模型中较强的结果。
更重要的是,它不只测静态科学题,还覆盖了 coding、terminal、research-oriented agentic tasks。
我的理解是,这篇论文的价值不在于某个分数,而在于它把科学大模型的评估边界拉宽了:从“是否能答对科学题”,扩展到“是否能处理科学工作流”。
它代表了科学模型的一次转向
如果要用一句话概括 Intern-S2-Preview,我会说:
它在尝试定义下一代 AI Scientist 的基础模型形态。
这个形态至少包括四件事。
第一,科学多模态。模型要读文本,也要读页面、图表、公式和实验数据。
第二,长程推理。科学任务需要持续推进。
第三,工具和环境交互。Agent 要能在真实工作流中调用工具、执行任务、接受验证。
第四,模块化记忆。面对长尾科学领域,模型需要在不重写 backbone 的情况下快速适配。
当然,它也还不是“自动科学家”。论文主要展示的是一个 preview 系列模型和训练框架,真实科研里的实验设计、假设发现、跨学科验证、失败归因,仍然远比 benchmark 复杂。
但这个方向值得关注:AI for Science 的竞争,可能正在从“谁更会答题”,转向“谁更像一个能持续工作的科学 Agent”。
论文:https://arxiv.org/abs/2608.13505
模型:https://huggingface.co/internlm/Intern-S2-Preview
夜雨聆风